# Ինչ է իրականում աշխատեցնում 128 ԳԲ unified հիշողությունը. լոկալ LLM-ներ՝ չափված

> 128 ԳԲ unified հիշողության դասն այսօր լոկալ LLM տուփերի ոսկե միջինն է, և դրա մասին գրվածի գրեթե ամբողջը սպեկ-թերթիկի թվաբանություն է։ Ահա ինչ է մեկ այդպիսի տուփ չափելիորեն անում. որ դասի մոդել է սպասարկում, ինչ արագ, քանի հոգու համար, և որտեղ է 128 ԳԲ-ն ավարտվում։

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/what-128gb-unified-memory-runs/

Կարճ, չափված պատասխանը. 128 ԳԲ unified հիշողությամբ տուփը հանգիստ
սպասարկում է 35B դասի MoE մոդել՝ մեկ ընթերցողին առաջին պատասխան-թոքենը
տալով վայրկյանից արագ, փոքր խումբը պահում է գործածելի ուշացման վրա, 32k
թոքենանոց փաստաթղթի միջով անցնում է առանց դրամայի և այդ ամենն անում է
ամբողջ օրը՝ առանց թուլանալու։ Ինչ այն չի գնում՝ բաց մոդելների ամենամեծ
դասը. դրա համար պահանջվեցին երկու այդպիսի տուփ՝ միացված արագ կապով, և
կարանները երևացին։ Ամեն պնդման ապացույցը՝ ստորև։

Այս սարքաշարային դասի մասին հրապարակվածի գրեթե ամբողջը այլ հարցի է
պատասխանում. որքան հիշողություն է խոստանում սպեկ-թերթիկը, և ինչ
կտեղավորվեր դրա մեջ թվաբանորեն։ Տեղավորվելը սպասարկել չէ։ Ստորև այն է, ինչ
մեկ 128 ԳԲ տուփ — Beelink GTR9 Pro՝ Ryzen AI Max+ 395-ով և Radeon
8060S-ով, llama.cpp-ն ամրագրված image-ի digest-ով — չափելիորեն արեց
սառեցված workload-ների վրա. ամեն թիվ տանում է իր շրջանակին,
սահմանափակումներին ու հում գործարկումներին։

## Որ դասի մոդել է սպասարկում, և ինչպես է դա զգացվում

Մեր ռեեստրի աշխատանքային ձին Qwen3.6-35B-A3B-ն է Q4_K_M-ում՝ 35B դասի MoE,
որի կշիռները զբաղեցնում են տուփի հիշողության մեկ երրորդից էապես քիչ՝ տեղ
թողնելով կոնտեքստի, cache-ի և երկրորդ բեռնված մոդելի համար։ Առօրյա
հարցումներին այն պատասխանում է
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/))-ում և
դեկոդում է **15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ով —
տեմպ, որը մեկ ընթերցողը զգում է որպես սահուն։ Ավելի ծանր Q8_0 քվանտը
նույնպես տեղավորվում է պաշարով. ինչ է այն տալիս և ինչ՝ ոչ,
[առանձին հաշվետվություն է](https://agmind.ai/hy/reports/q8-0-vs-q4-k-m-strix-halo/)։

Երկրորդ մոդելային ընտանիքը՝ gemma-4-26B-A4B, չափված է նույն տուփի վրա
[փոխարինումների հաշվետվության մեջ](https://agmind.ai/hy/reports/model-quant-backend-strix-halo/).
իմաստն այն է, որ 128 ԳԲ-ի վրա մոդելային ընտանիք փոխելը որակի ու վարքի
որոշում է, ոչ թե հարց, թե կշիռները կտեղավորվե՞ն։

## Երկար փաստաթղթեր

Հիշողության ծավալը երկար կոնտեքստի աշխատանքի միայն կեսն է. մյուս կեսը
prefill-ի հաշիվն է։ 32k թոքենանոց փաստաթղթի վրա առաջին հարցն այս տուփին
արժե **33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)), իսկ երբ
llama.cpp-ի prompt cache-ն անում է իր գործը, նույն փաստաթղթի վրա երկրորդ
հարցն արժե
**860 ms** ([strix.qwen36.docsession.c1.ttft-q2-32k-cache](https://agmind.ai/claims/strix.qwen36.docsession.c1.ttft-q2-32k-cache/))։
Տարբերությունն այն ընթացակարգի միջև, որը լցնելու գինը վճարում է մեկ
անգամ, և այն, որը վճարում է ամեն հարցման վրա,
[առանձին պատմություն է](https://agmind.ai/hy/reports/llamacpp-prompt-cache-strix-halo/)։

## Մեկ հոգուց ավելին

Չորս միաժամանակյա չաթի դեպքում առաջին պատասխան-թոքենի մեդիան սպասումը
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)) է, ութի
դեպքում՝ **865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)), և
ամբողջական պատասխանների բաժինը պահվում է ամեն աստիճանի վրա։ Ամբողջ
սանդուղքը, և թե ինչու հարցումն աշխատակից չէ,
[տարողունակության հաշվետվության մեջ է](https://agmind.ai/hy/reports/concurrency-capacity-strix-halo/)։

## Ամբողջ օրը

Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպն առաջին հինգ րոպեի և
վերջինի միջև շարժվեց
**1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/))-ով —
երկարատև բեռի տակ մարումը, որ կանխատեսում են մինի-համակարգիչների
թերահավատները, [չեկավ](https://agmind.ai/hy/reports/strix-halo-sustained-load-3-hours/)
մեր երկու նույնական միավորներից ոչ մեկի վրա։

## Որտեղ է 128 ԳԲ-ն ավարտվում

Բաց MoE-ների ամենամեծ դասը մեկ այդպիսի տուփի մեջ չի տեղավորվում։ 284B
պարամետրանոց մոդել սպասարկելու համար պահանջվեցին երկու 128 ԳԲ միավոր
tensor parallel-ում՝ արագ կապի վրայով, runtime-ի դրոշ, որն ավտոմատ ռեժիմը
բաց է թողնում, և իրական գործարկման աշխատանք։ Չափված պատմությունը
[DGX Spark գնորդի պատասխանն է](https://agmind.ai/hy/reports/dgx-spark-worth-it/) և
[զույգի բենչմարք-աղյուսակները](https://github.com/botAGI/dgx-spark-llm-benchmarks)։
Մեկ տուփը 35B դասը սպասարկում է գերազանց. ֆրոնտիր դասը երկու տուփի
նախագիծ է՝ կարաններով։

## Ինչ այս էջը ՉԻ պնդում

- **Մեկ վաճառողի տուփ, մեկ runtime-ընտանիք։** 128 ԳԲ unified հիշողությամբ
  այլ մեքենաներ — առաջին հերթին Apple-ինը — [մեր ստենդներում](https://agmind.ai/hy/testbed/)
  հայտարարված ուղիներ են՝ դեռ առանց հրապարակված գործարկումների. մենք
  դրանց վրա չենք էքստրապոլացնում։
- **Գնային խորհուրդ չկա։** Սարքաշարի գները շարժվում են. լաբորատորիան դրանք
  չի հրապարակում։
- **Ավելի փոքր աստիճաններն այստեղ չափված չեն։** Ինչ են 8–24 ԳԲ VRAM-ն
  անում նույն workload-ների հետ՝ այլ ուսումնասիրություն է. պլանավորված,
  բայց չարված։

Վերևի ամեն թիվ ունի մշտական էջ՝ հում գործարկումներով,
[claim-երի ռեեստրում](https://agmind.ai/hy/claims/). այս տուփի ամբողջական չափված
աղյուսակները
[Strix Halo բենչմարքների պահոցում են](https://github.com/botAGI/strix-halo-llm-benchmarks)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
