Հաշվետվություն

Ինչ է իրականում աշխատեցնում 128 ԳԲ unified հիշողությունը. լոկալ LLM-ներ՝ չափված

128 ԳԲ unified հիշողության դասն այսօր լոկալ LLM տուփերի ոսկե միջինն է, և դրա մասին գրվածի գրեթե ամբողջը սպեկ-թերթիկի թվաբանություն է։ Ահա ինչ է մեկ այդպիսի տուփ չափելիորեն անում. որ դասի մոդել է սպասարկում, ինչ արագ, քանի հոգու համար, և որտեղ է 128 ԳԲ-ն ավարտվում։

lab_repeated internal research 20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Կարճ, չափված պատասխանը. 128 ԳԲ unified հիշողությամբ տուփը հանգիստ սպասարկում է 35B դասի MoE մոդել՝ մեկ ընթերցողին առաջին պատասխան-թոքենը տալով վայրկյանից արագ, փոքր խումբը պահում է գործածելի ուշացման վրա, 32k թոքենանոց փաստաթղթի միջով անցնում է առանց դրամայի և այդ ամենն անում է ամբողջ օրը՝ առանց թուլանալու։ Ինչ այն չի գնում՝ բաց մոդելների ամենամեծ դասը. դրա համար պահանջվեցին երկու այդպիսի տուփ՝ միացված արագ կապով, և կարանները երևացին։ Ամեն պնդման ապացույցը՝ ստորև։

Այս սարքաշարային դասի մասին հրապարակվածի գրեթե ամբողջը այլ հարցի է պատասխանում. որքան հիշողություն է խոստանում սպեկ-թերթիկը, և ինչ կտեղավորվեր դրա մեջ թվաբանորեն։ Տեղավորվելը սպասարկել չէ։ Ստորև այն է, ինչ մեկ 128 ԳԲ տուփ — Beelink GTR9 Pro՝ Ryzen AI Max+ 395-ով և Radeon 8060S-ով, llama.cpp-ն ամրագրված image-ի digest-ով — չափելիորեն արեց սառեցված workload-ների վրա. ամեն թիվ տանում է իր շրջանակին, սահմանափակումներին ու հում գործարկումներին։

Որ դասի մոդել է սպասարկում, և ինչպես է դա զգացվում

Մեր ռեեստրի աշխատանքային ձին Qwen3.6-35B-A3B-ն է Q4_K_M-ում՝ 35B դասի MoE, որի կշիռները զբաղեցնում են տուփի հիշողության մեկ երրորդից էապես քիչ՝ տեղ թողնելով կոնտեքստի, cache-ի և երկրորդ բեռնված մոդելի համար։ Առօրյա հարցումներին այն պատասխանում է 210մվunit_replicated-ում և դեկոդում է 15.9մվ/թոքենrepeated-ով — տեմպ, որը մեկ ընթերցողը զգում է որպես սահուն։ Ավելի ծանր Q8_0 քվանտը նույնպես տեղավորվում է պաշարով. ինչ է այն տալիս և ինչ՝ ոչ, առանձին հաշվետվություն է։

Երկրորդ մոդելային ընտանիքը՝ gemma-4-26B-A4B, չափված է նույն տուփի վրա փոխարինումների հաշվետվության մեջ. իմաստն այն է, որ 128 ԳԲ-ի վրա մոդելային ընտանիք փոխելը որակի ու վարքի որոշում է, ոչ թե հարց, թե կշիռները կտեղավորվե՞ն։

Երկար փաստաթղթեր

Հիշողության ծավալը երկար կոնտեքստի աշխատանքի միայն կեսն է. մյուս կեսը prefill-ի հաշիվն է։ 32k թոքենանոց փաստաթղթի վրա առաջին հարցն այս տուփին արժե 33965մվrepeated, իսկ երբ llama.cpp-ի prompt cache-ն անում է իր գործը, նույն փաստաթղթի վրա երկրորդ հարցն արժե 860մվrepeated։ Տարբերությունն այն ընթացակարգի միջև, որը լցնելու գինը վճարում է մեկ անգամ, և այն, որը վճարում է ամեն հարցման վրա, առանձին պատմություն է։

Մեկ հոգուց ավելին

Չորս միաժամանակյա չաթի դեպքում առաջին պատասխան-թոքենի մեդիան սպասումը 338մվrepeated է, ութի դեպքում՝ 865մվrepeated, և ամբողջական պատասխանների բաժինը պահվում է ամեն աստիճանի վրա։ Ամբողջ սանդուղքը, և թե ինչու հարցումն աշխատակից չէ, տարողունակության հաշվետվության մեջ է։

Ամբողջ օրը

Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպն առաջին հինգ րոպեի և վերջինի միջև շարժվեց 1.6%single_run-ով — երկարատև բեռի տակ մարումը, որ կանխատեսում են մինի-համակարգիչների թերահավատները, չեկավ մեր երկու նույնական միավորներից ոչ մեկի վրա։

Որտեղ է 128 ԳԲ-ն ավարտվում

Բաց MoE-ների ամենամեծ դասը մեկ այդպիսի տուփի մեջ չի տեղավորվում։ 284B պարամետրանոց մոդել սպասարկելու համար պահանջվեցին երկու 128 ԳԲ միավոր tensor parallel-ում՝ արագ կապի վրայով, runtime-ի դրոշ, որն ավտոմատ ռեժիմը բաց է թողնում, և իրական գործարկման աշխատանք։ Չափված պատմությունը DGX Spark գնորդի պատասխանն է և զույգի բենչմարք-աղյուսակները։ Մեկ տուփը 35B դասը սպասարկում է գերազանց. ֆրոնտիր դասը երկու տուփի նախագիծ է՝ կարաններով։

Ինչ այս էջը ՉԻ պնդում

Վերևի ամեն թիվ ունի մշտական էջ՝ հում գործարկումներով, claim-երի ռեեստրում. այս տուփի ամբողջական չափված աղյուսակները Strix Halo բենչմարքների պահոցում են։

Առնչվող ստուգված կոնֆիգուրացիաներ

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-20). Ինչ է իրականում աշխատեցնում 128 ԳԲ unified հիշողությունը. լոկալ LLM-ներ՝ չափված. Evidence level: lab_repeated. https://agmind.ai/hy/reports/what-128gb-unified-memory-runs/
← Հաշվետվություններ