Կարճ տարբերակը. երեք ժամ անընդհատ սերվինգի ընթացքում երկու նույնական միավորի վրա տեմպը, որ այս տուփը ցույց տվեց առաջին րոպեներին, նույնն է, ինչ ցույց տվեց երրորդ ժամին։ «Պոռթկում, հետո մարում» պատկերը, որ կանխատեսում են սկեպտիկները, ոչ մի միավորի վրա այդպես էլ չեկավ։ Ստենդը, շեղման թիվը և դրա ազնիվ սահմանափակումները ստորև են։
Հարցրեք ֆորումին՝ կարո՞ղ է մինի-համակարգիչն ամբողջ օրը լեզվական մոդել սպասարկել, և պատասխանը կժամանի ավելի շուտ, քան ձեր հարցը մինչև վերջ կտեղադրվի. կգերտաքանա ու կդանդաղի։ Փոքր իրան, ընդհանուր ջերմափոխանակիչ, երկարատև բեռ — ֆիզիկայի փաստարկը գրվում է ինքն իրեն։ Ինչ այդ պատասխանը երբեք չի պարունակում՝ չափում։ Ուստի մենք արեցինք այն. երեք ժամ անընդհատ սերվինգ, առանց դադարների, երկու սերիական նույնական միավորի վրա, և մեքենայի վերջին հինգ րոպեն համեմատեցինք առաջինի հետ։
Ստենդը
Երկու Beelink GTR9 Pro միավոր, յուրաքանչյուրը՝ Ryzen AI Max+ 395-ով և 128 ԳԲ unified հիշողությամբ, յուրաքանչյուրի վրա llama.cpp server՝ Vulkan backend-ով, build-ն ամրագրված image-ի digest-ով, սպասարկվում է Qwen3.6-35B-A3B Q4_K_M՝ ամրագրված արտեֆակտի հեշով։ Closed-loop բեռ չորս զուգահեռությամբ. հենց մի հարցումն ավարտվում է, մեկնարկում է հաջորդը, չորս հոսք ամեն պահի, 180 րոպե անընդմեջ։ Reasoning-ն անջատած է։ Ամեն հարցում դատվում է սովորական gate-երով, ձախողումները մնում են հայտարարի մեջ։
Նախ ազնիվ տարօրինակությունը. workload-ի id-ն ասում է endurance-30m-v1,
որովհետև երեսուն րոպեն սկզբնական checkpoint-ն էր։ Անցումն ինքը երեք ժամ է
տևում։ Id-ն մնում է. արխիվի կեսից workload-ների ինքնությունները
վերանվանելը հենց այն ճանապարհն է, որով հրապարակված թվերը դադարում են
հետագծելի լինել։
Թուլանո՞ւմ է Strix Halo-ն երկարատև LLM բեռի տակ
Դեկոդի տեմպն ողջ անցման ընթացքում մնաց 30.0մվ/թոքենsingle_run-ի վրա։ Շեղումն առաջին հինգ րոպեի և 175-ից 180-րդ րոպեների միջև — թիվը, որը գերտաքացման փաստարկի կանխատեսմամբ պետք է մեծ լիներ — կազմեց 1.6%single_run՝ երկու միավորի տվյալները միասին վերցրած։
Ավարտվածությունը նույն պատմությունն է պատմում. ողջ անցման ընթացքում հարցումների 100.0հարցումների %single_run-ը վերադարձրել է ամբողջական, ոչ դատարկ պատասխան։ Ոչ դանդաղ մարում, ոչ կանգ անցման կեսին, ոչ լուռ կտրվածք, որ ներս սողար իրանի տաքանալուն զուգընթաց։ Երկու միավոր, նույն ձևը։
Դեկոդի տեմպի շեղումը ջերմային թուլացո՞ւմ է
Պնդումն ավելի նեղ է, քան «Strix Halo-ն չի թուլանում բեռի տակ», և տարբերությունը կարևոր է։ Մեկ եռաժամյա անցում յուրաքանչյուր միավորին, մեկ կորպուս, զուգահեռության մեկ մակարդակ, մեկ մոդել, շրջակա ջերմաստիճանը գործիքավորված չէ։ Ավելի տաք սենյակը, ավելի ծանր զուգահեռությունը, ավելի խիտ workload-ը — ամեն մեկը կարող էր շարժել արդյունքը; die-ի ջերմաստիճանները փաստագրված են գործարկման նոթերում՝ բոլոր նրանց համար, ովքեր ուզում են ջերմայինի հետ ուղղակիորեն վիճել։
Ինչ չափումն իրոք հաստատում է. այս սերվինգ-բեռի տակ տեմպը, որ տուփը ցույց է տալիս առաջին րոպեին, նույնն է, ինչ ցույց է տալիս երրորդ ժամին։ «Պոռթկում, հետո մարում» պատկերը, որ կանխատեսում են մինի-համակարգիչների սկեպտիկները, ոչ մի միավորի վրա չհայտնվեց։
Ինչ սա ՉԻ ասում
- Ջերմային վճիռ չէ։ Չափվել է սերվինգի վարքը, ոչ թե junction-սահմանները։
Պատկերը վերարտադրվեց երկու միավորի վրա; կրկնումները մեկ միավորի ներսում
դեռ առջևում են — հենց դրա համար ապացույցի մակարդակը
lab_single_runէ։ - Չորս զուգահեռությունն ազատ ընտրություն չէ։ Դա զուգահեռության սանդուղքի օպտիմալ կետն է — սպասման պատկերը մեկ, չորս և ութ հոսքի դեպքում առանձին հաշվետվություն է։
- Closed loop-ը վատագույն դեպքն է ջերմության, ոչ թե ռեալիզմի համար։ Իրական թիմերը դադարներ ունեն հաղորդագրությունների միջև։ Տուփը, որը տեմպը պահում է զրո պարապուրդի պայմաններում, պոռթկումային գրասենյակային ռիթմում պաշար ունի, ոչ թե պակասուրդ։
Ստուգված կոնֆիգուրացիայի վճիռը՝ endurance քարտում; ամեն թիվ ունի մշտական էջ՝ շրջանակով, սահմանափակումներով և հում ապացույցներով claim-երի ռեեստրում, իսկ կնքված գործարկումների փաթեթները՝ հրապարակային արխիվում։