Նախ ազնիվ վերնագիրը. սրանք տարբեր գործիքներ են, որոնց շուկան համառորեն համեմատում է ճակատով։ Մի տուփը չափված, ձանձրալի աշխատանքային ձի է մոդելների այն դասի համար, որ մարդկանց մեծ մասն իրապես քշում է։ Մյուսի զույգը մեզ հայտնի միակ սեղանային ձևաչափն է բաց MoE-ների ամենամեծ դասը սպասարկելու — իրական օպերացիոն սուր եզրերով։ Մենք ունենք և չափել ենք երկուսն էլ; այս համեմատության որոնման արդյունքներում ոչ ոք դա չի արել։
Ինչո՞ւ է այս համեմատությունն այդքան դժվար գտնել չափված
Որովհետև այն ազնվորեն անելն իսկապես անհարմար է։ Երկու պլատֆորմներն ուզում են տարբեր runtime-ներ, նախընտրում են տարբեր մոդելային դասեր, և ամեն հրապարակված դեմ առ դեմ, որ գտանք, կամ վերարտադրում է վենդորի թվերը, կամ կողք կողքի մեջբերում է համայնքի երկու անհամատեղելի թիվ — ահա այսպես է ծնվում բենչմարքային ֆոլկլորը։ Ստորև երկու տուփերը պահվում են առանձին, հստակ շրջանակված սյունակներում, իսկ վերջին բաժինն անվանում է չափումը, որը դրանք կմիավորեր ինչպես հարկն է։
Ինչ արեց Strix Halo տուփն իրապես
Մեկ Ryzen AI Max+ 395 միավոր 128 ԳԲ unified հիշողությամբ, llama.cpp-ն ամրագրված digest-ով, սպասարկում է 35B դասի MoE։ Առօրյա հարցումներ. առաջին պատասխան-թոքենը 210մվunit_replicated-ում։ Չորս միաժամանակյա չաթ. 338մվrepeated մինչև առաջին բառը, ավարտվածությունը պահվում է 100.0հարցումների %repeated-ի վրա նույնիսկ ութ հոսքի դեպքում։ 32k թոքենանոց փաստաթուղթը նախապես արժե 33965մվrepeated, իսկ երեք ժամ շարունակական սպասարկումը տեմպը պահեց 30.0մվ/թոքենsingle_run-ի վրա։ Ամբողջական աղյուսակները բենչմարքների պահոցում են և 128 ԳԲ հաշվետվության մեջ։
Ինչ արեց DGX Spark զույգն իրապես
Երկու GB10 միավոր 200G կապի վրայով vLLM-ի միջոցով սպասարկեցին DeepSeek-V4-Flash-ը — 284B պարամետրանոց MoE — բավական կայուն, որ հրապարակվեն հում գործարկումները և բաղադրատոմսը՝ նշված թակարդներով։ Զույգն անցավ կոնտեքստի կորը մինչև միլիոն թոքեն և ասաց ճշմարտությունը հաշվի մասին. դեկոդը խորության վրա հարթակվում է, բայց միլիոն թոքենանոց պատուհանի առաջին լցնումը իրադարձություն է, որ պլանավորում ես, ոչ թե հարցում, որ պարզապես ուղարկում ես։ Գործարկումը հասցնելը իրական աշխատանք էր — միջուկի ընտրության դրոշը, որն ավտոմատ ռեժիմը բաց է թողնում, արագ կոնֆիգուրացիան բաժանում է նրանից, որ մարդկանց մեծ մասը չափում է, իսկ ստանդարտ GPU մոնիտորինգը լավագույն դեպքում կիսով չափ է աշխատում։ Գնորդի պատասխանը, ներառյալ՝ ով չպիտի գնի, առանձին էջ է։
Ո՞ր տուփը որ workload-ի համար
Չափվածից ելնելով, ոչ սպեկ-թերթիկներից։ Անձնական օգնական, փոքր թիմի չաթ-տուփ, փաստաթղթերի Q&A տասնյակ հազարավոր թոքենների միջակայքում, JSON-ավտոմատացում. Strix Halo տուփն այս ամենն անում է այսօր, հանգիստ, վերևի թվերով։ Բաց MoE-ների ամենամեծ դասը սեփական տանիքի տակ սպասարկելը, կամ երկար կոնտեքստի հետազոտություն, որտեղ միլիոն թոքենանոց պատուհանն արդարանում է. ահա ինչ արեց Spark զույգը չափելիորեն, և մեր ստենդներում այս չափի ոչինչ դրան չհավասարվեց։ Եթե ձեր հարցը «որը՝ տնային օգնականի համար» է, ընտրում եք չափված այո-ի և գերորակավորված գուցե-ի միջև։ Եթե ձեր հարցը «կարո՞ղ եմ ֆրոնտիր բաց մոդելները սպասարկել լոկալ» է, այս պլատֆորմներից միայն մեկը դա արեց մեր լաբորատորիայում — որպես զույգ, կարաններով։
Ինչո՞ւ մեր թվերը չեն համընկնում ձեր կարդացած ակնարկների հետ
Որովհետև երկու պլատֆորմների հրապարակված թվերի մեծ մասը քողարկված կոնֆիգներ են. չնշված workload-պրոֆիլներ, տեղաշարժված դեֆոլտներ, թարմացումից առաջվա firmware։ Եվս մեկ որբ թիվ ավելացնելու փոխարեն գրեցինք իրար հակասող Spark թվերի հաշտեցումը և արձանագրություն՝ այնպիսի թվեր հրապարակելու, որոնց հետ հնարավոր է վիճել։ Երկուսն էլ վերաբերում են այս էջի ցանկացած թվին։
Ինչ մենք ՉԵՆՔ չափել
Մաքուր համեմատությունը — նույն մոդելը, նույն runtime-ը, նույն workload-ը, երկու տուփն էլ, մեկ harness — դեռ գոյություն չունի, ոչ այստեղ, ոչ որևէ տեղ, որ կարողացանք գտնել։ Մեր Strix ուղին Qwen3.6-ն ու gemma-4-ը քշեց llama.cpp-ի տակ; մեր Spark ուղին DeepSeek-V4-Flash-ը՝ vLLM-ի տակ։ Ցանկացած աղյուսակ, որ այդ թվերը կդներ հարևան սյունակներում, կարտադրեր ճիշտ այն ֆոլկլորը, որը հերքելու համար մենք գոյություն ունենք, ուստի այս էջում այդպիսի աղյուսակ չկա։ Նույն harness-ով միջսարքային բջիջը պլանավորված է; երբ այն հասնի, նրա claim-երը կկրեն համակարգային մակարդակի համեմատության շրջանակ, և այս էջը կփոխարինվի ավելի լավով։ Մինչ այդ. երկու ազնիվ սյունակ ավելի լավ են, քան մեկ կեղծ աղյուսակ։
Վերևի ամեն Strix թիվ ունի մշտական էջ՝ հում գործարկումներով, claim-երի ռեեստրում; ամեն Spark պնդում հղում է իր հրապարակված գործարկումների պահոցին։