Կարճ, չափված պատասխանը. 128 ԳԲ unified հիշողությամբ տուփը հանգիստ սպասարկում է 35B դասի MoE մոդել՝ մեկ ընթերցողին առաջին պատասխան-թոքենը տալով վայրկյանից արագ, փոքր խումբը պահում է գործածելի ուշացման վրա, 32k թոքենանոց փաստաթղթի միջով անցնում է առանց դրամայի և այդ ամենն անում է ամբողջ օրը՝ առանց թուլանալու։ Ինչ այն չի գնում՝ բաց մոդելների ամենամեծ դասը. դրա համար պահանջվեցին երկու այդպիսի տուփ՝ միացված արագ կապով, և կարանները երևացին։ Ամեն պնդման ապացույցը՝ ստորև։
Այս սարքաշարային դասի մասին հրապարակվածի գրեթե ամբողջը այլ հարցի է պատասխանում. որքան հիշողություն է խոստանում սպեկ-թերթիկը, և ինչ կտեղավորվեր դրա մեջ թվաբանորեն։ Տեղավորվելը սպասարկել չէ։ Ստորև այն է, ինչ մեկ 128 ԳԲ տուփ — Beelink GTR9 Pro՝ Ryzen AI Max+ 395-ով և Radeon 8060S-ով, llama.cpp-ն ամրագրված image-ի digest-ով — չափելիորեն արեց սառեցված workload-ների վրա. ամեն թիվ տանում է իր շրջանակին, սահմանափակումներին ու հում գործարկումներին։
Որ դասի մոդել է սպասարկում, և ինչպես է դա զգացվում
Մեր ռեեստրի աշխատանքային ձին Qwen3.6-35B-A3B-ն է Q4_K_M-ում՝ 35B դասի MoE, որի կշիռները զբաղեցնում են տուփի հիշողության մեկ երրորդից էապես քիչ՝ տեղ թողնելով կոնտեքստի, cache-ի և երկրորդ բեռնված մոդելի համար։ Առօրյա հարցումներին այն պատասխանում է 210մվunit_replicated-ում և դեկոդում է 15.9մվ/թոքենrepeated-ով — տեմպ, որը մեկ ընթերցողը զգում է որպես սահուն։ Ավելի ծանր Q8_0 քվանտը նույնպես տեղավորվում է պաշարով. ինչ է այն տալիս և ինչ՝ ոչ, առանձին հաշվետվություն է։
Երկրորդ մոդելային ընտանիքը՝ gemma-4-26B-A4B, չափված է նույն տուփի վրա փոխարինումների հաշվետվության մեջ. իմաստն այն է, որ 128 ԳԲ-ի վրա մոդելային ընտանիք փոխելը որակի ու վարքի որոշում է, ոչ թե հարց, թե կշիռները կտեղավորվե՞ն։
Երկար փաստաթղթեր
Հիշողության ծավալը երկար կոնտեքստի աշխատանքի միայն կեսն է. մյուս կեսը prefill-ի հաշիվն է։ 32k թոքենանոց փաստաթղթի վրա առաջին հարցն այս տուփին արժե 33965մվrepeated, իսկ երբ llama.cpp-ի prompt cache-ն անում է իր գործը, նույն փաստաթղթի վրա երկրորդ հարցն արժե 860մվrepeated։ Տարբերությունն այն ընթացակարգի միջև, որը լցնելու գինը վճարում է մեկ անգամ, և այն, որը վճարում է ամեն հարցման վրա, առանձին պատմություն է։
Մեկ հոգուց ավելին
Չորս միաժամանակյա չաթի դեպքում առաջին պատասխան-թոքենի մեդիան սպասումը 338մվrepeated է, ութի դեպքում՝ 865մվrepeated, և ամբողջական պատասխանների բաժինը պահվում է ամեն աստիճանի վրա։ Ամբողջ սանդուղքը, և թե ինչու հարցումն աշխատակից չէ, տարողունակության հաշվետվության մեջ է։
Ամբողջ օրը
Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպն առաջին հինգ րոպեի և վերջինի միջև շարժվեց 1.6%single_run-ով — երկարատև բեռի տակ մարումը, որ կանխատեսում են մինի-համակարգիչների թերահավատները, չեկավ մեր երկու նույնական միավորներից ոչ մեկի վրա։
Որտեղ է 128 ԳԲ-ն ավարտվում
Բաց MoE-ների ամենամեծ դասը մեկ այդպիսի տուփի մեջ չի տեղավորվում։ 284B պարամետրանոց մոդել սպասարկելու համար պահանջվեցին երկու 128 ԳԲ միավոր tensor parallel-ում՝ արագ կապի վրայով, runtime-ի դրոշ, որն ավտոմատ ռեժիմը բաց է թողնում, և իրական գործարկման աշխատանք։ Չափված պատմությունը DGX Spark գնորդի պատասխանն է և զույգի բենչմարք-աղյուսակները։ Մեկ տուփը 35B դասը սպասարկում է գերազանց. ֆրոնտիր դասը երկու տուփի նախագիծ է՝ կարաններով։
Ինչ այս էջը ՉԻ պնդում
- Մեկ վաճառողի տուփ, մեկ runtime-ընտանիք։ 128 ԳԲ unified հիշողությամբ այլ մեքենաներ — առաջին հերթին Apple-ինը — մեր ստենդներում հայտարարված ուղիներ են՝ դեռ առանց հրապարակված գործարկումների. մենք դրանց վրա չենք էքստրապոլացնում։
- Գնային խորհուրդ չկա։ Սարքաշարի գները շարժվում են. լաբորատորիան դրանք չի հրապարակում։
- Ավելի փոքր աստիճաններն այստեղ չափված չեն։ Ինչ են 8–24 ԳԲ VRAM-ն անում նույն workload-ների հետ՝ այլ ուսումնասիրություն է. պլանավորված, բայց չարված։
Վերևի ամեն թիվ ունի մշտական էջ՝ հում գործարկումներով, claim-երի ռեեստրում. այս տուփի ամբողջական չափված աղյուսակները Strix Halo բենչմարքների պահոցում են։