# Ի՞նչ սարքաշար լոկալ LLM-ի համար. չափված պատասխան՝ ըստ workload-ի

> Լոկալ AI-ի սարքաշարային ուղեցույցների գրեթե ամբողջը սպեկ-թերթիկ է, վենդորի ինքնագրախոսություն կամ VRAM-աստիճաններ վերարտադրող ցուցակ։ Այս էջը սկսում է workload-ից, բերում է միայն մեր տուփերի վրա չափված թվերը և բացահայտ անվանում այն ուղիները, որոնց մասին տվյալ չունենք։

- Published: 2026-08-21
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/local-llm-homelab-hardware/

Կարճ տարբերակը. նախ ընտրիր workload-ը, հետո՝ տուփը։ Մեկ հոգու օգնականը,
թիմային չաթ-տուփը և միլիոն թոքենի հետազոտական ստենդը երեք տարբեր գնում
են, և ամեն մեկը որոշող թիվը տարբեր է։ Ստորև այն է, ինչ մեր սարքաշարը
չափելիորեն արեց ամեն workload-ի համար — և նույնքան կարևոր՝ այն
workload-ները, որոնց մասին տվյալ չունենք և հրաժարվում ենք հորինել։

## Ինչո՞ւ են լոկալ AI-ի սարքաշարային ուղեցույցներն այդքան վատ

Փնտրիր «լավագույն երկաթը լոկալ LLM-ի համար»-ի ցանկացած տարբերակ, և
արդյունքները կունենան նույն կառուցվածքը. GPU-ների աղյուսակ ըստ VRAM-ի,
հիշողության թվաբանության մեկ պարբերություն, առաջարկություն։ Փնտրիր այդ
առաջարկության տակ դրված չափումը — սովորաբար չկա։ Վենդորները
ռանկավորվում են իրենց իսկ ապրանքային կատեգորիաներով. մինի-համակարգիչների
որոնման վերին արդյունքները հաճախ հենց մինի-համակարգիչ վաճառողներն են՝
գրախոսելով իրենք իրենց։ Գործընկերային ցուցակները մեջբերում են վայրկյանում
թոքենների ցուցանիշներ, որոնք մի քանի քայլով հանգում են երկու-երեք
սկզբնաղբյուրի՝ մերկացված այն մոդելից, քվանտից, կոնտեքստի երկարությունից
և runtime-ից, որոնք դրանք ծնել են։ Հենց այդ մերկացումն է ամբողջ խնդիրը.
[բենչմարքային թիվը քողարկված կոնֆիգ
է](https://agmind.ai/hy/essays/benchmark-number-config-in-disguise/), իսկ առանց կոնֆիգի
թիվը գնում որոշել չի կարող։

Այս էջն ավելի նեղ է և, կարծում ենք, ավելի օգտակար. ինչ իրապես արեցին մեր
տիրապետած սարքաշարի երկու դասերը՝ սառեցված workload-ների տակ, ամեն թիվ
հղված իր հում գործարկումներին։

## Սկսիր workload-ից, ոչ թե տուփից

Չորս հարց որոշում է լոկալ AI-ի սարքաշարային գրեթե ամեն ընտրություն։
Պատասխանիր դրանց, նախքան մեկ սպեկ-թերթիկ բացելը։

**Քանի՞ հոգի։** Մեկ մարդու օգնականը և հնգանոց թիմը տարբեր մեքենաներ են —
ոչ թե հում արագության պատճառով, այլ որովհետև սպասումն այլ կերպ է աճում
զուգահեռության տակ։

**Որքա՞ն երկար են prompt-երը։** Չաթային workload-ը և «տեղադրիր 50
էջանոց փաստաթուղթը» workload-ը մեքենայի տարբեր մասերն են լարում։
Երկրորդում գերիշխում է prefill-ը, որն իրեն բոլորովին այլ կերպ է պահում,
քան գեներացիան։

**Որքա՞ն մեծ է մոդելն իրականում։** Ոչ թե պարամետրերի քանակը, այլ դասը։
35B դասի mixture-of-experts մոդելը և 284B-անոցն ապրում են այնպիսի սահմանի
երկու կողմերում, որը մեկ տուփի մեջ դրված ոչ մի ծավալի unified հիշողություն
չի հատում։

**Ամբողջ օ՞րը միացված է։** Տասը րոպե արագ տուփը և ութ ժամ իր տեմպը պահող
տուփը տարբեր ապրանքներ են, և այդ տարբերությունը ոչ մի սպեկ-թերթիկում չի
երևում։

## Ինչ է անում 128 ԳԲ unified հիշողությամբ տուփը

Մեր աշխատանքային ձիու դասը. Ryzen AI Max+ 395 մեքենա 128 ԳԲ unified
հիշողությամբ, llama.cpp-ն ամրագրված image-ի digest-ով, սպասարկում է 35B
դասի MoE մոդել։ Այստեղի ամեն ինչ չափված է սառեցված workload-ների վրա՝
ձախողումները հայտարարի մեջ պահած։

**Անհատական օգնական։** Առաջին պատասխան-թոքենը՝
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/))-ում,
դեկոդը՝ **15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ով —
այն շեմից ցածր, որտեղ մարդը սկսում է սպասում գրանցել, և ընթերցանության
տեմպից առաջ։ Առօրյա գործերով մեկ օգտվողի համար այս դասի տուփը դադարեց
խցան լինելուց։

**Փոքր թիմ։** Չորս միաժամանակյա չաթի դեպքում առաջին բառի մեդիան սպասումը
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)) է, ութի
դեպքում՝ **865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)),
ընդ որում ավարտվածությունը պահվում է
**100.0 % of requests** ([strix.qwen36.interactive2.c8.completion-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.completion-nothink/))-ի
վրա։ [Ամբողջական սանդուղքը](https://agmind.ai/hy/reports/concurrency-capacity-strix-halo/)
ազնվորեն չափսավորելու եղանակն է. ընտրիր այն սպասումը, որ քո օգտվողները
հանդուրժում են, և կարդա այն հակառակ ուղղությամբ։

**Երկար փաստաթղթեր։** 32k թոքենանոց փաստաթղթի վրա առաջին հարցն արժե
**33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)) — դա prefill-ի
հաշիվն է, և հենց այս թվին պետք է նայեն փաստաթղթային հոսքեր գնողները՝
դեկոդի արագության փոխարեն։ Մնա նույն սեսիայում, և prompt cache-ը հաջորդ
հարցը վերադարձնում է
**860 ms** ([strix.qwen36.docsession.c1.ttft-q2-32k-cache](https://agmind.ai/claims/strix.qwen36.docsession.c1.ttft-q2-32k-cache/))-ում.
[մեխանիկան և այն մեկ պայմանը, որ դրան
պետք է](https://agmind.ai/hy/reports/llamacpp-prompt-cache-strix-halo/), այստեղ ավելի
կարևոր են, քան սարքաշարը։

**Ամբողջ օրը։** Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպը
շարժվեց **1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/))-ով՝
երկու առևտրորեն նույնական միավորի վրա։
[Շարունակական բեռի հաշվետվությունը](https://agmind.ai/hy/reports/strix-halo-sustained-load-3-hours/)
պատասխանում է «կխեղդվի՞ մինի-համակարգիչը, եթե թողնեմ սպասարկելու»
հարցին։

**Ավտոմատացում։** Խիստ JSON պահանջող առաջադրանքներն ավարտվեցին
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/))-ով —
և [հուսալիության փոփոխականը պարզվեց, որ մոդելն է, ոչ թե
կարգավորումները](https://agmind.ai/hy/reports/local-llm-json-reliability/)։

Ինչ է այս հիշողության դասն ընդհանրապես աշխատեցնում՝
[առանձին էջ է](https://agmind.ai/hy/reports/what-128gb-unified-memory-runs/), իսկ
ամբողջական չափված աղյուսակներն ապրում են
[բենչմարքների պահոցում](https://github.com/botAGI/strix-halo-llm-benchmarks)։

## Ինչ է անում DGX Spark-ի զույգը

Մեր տիրապետած մյուս դասը. երկու GB10 միավոր՝ միացված 200G կապով,
սպասարկում են 284B պարամետրանոց MoE vLLM-ի միջոցով։ Սա պատասխանում է
որոշակի հարցի — բաց կշիռների ֆրոնտիր դասը սեփական տանիքի տակ քշել — և
գալիս է օպերացիոն տնային աշխատանքով.
[միջուկի ընտրության դրոշ, որն ավտոմատ ռեժիմը բաց է
թողնում](https://agmind.ai/hy/reports/dsv4-flash-moe-backend-dgx-spark/),
[ստանդարտ GPU մոնիտորինգ, որը կիսով չափ է
աշխատում](https://agmind.ai/hy/reports/dgx-spark-gpu-monitoring/), և
[կոնտեքստի կոր մինչև միլիոն
թոքեն](https://agmind.ai/hy/reports/dspark-speculative-1m-dgx-spark/), որի առաջին լցնումն
իրադարձություն է, որ պլանավորում ես, ոչ թե հարցում, որ պարզապես
ուղարկում ես։ Չափված գնորդական պատասխանը, ներառյալ՝ ով չպիտի գնի,
[առանձին էջ է](https://agmind.ai/hy/reports/dgx-spark-worth-it/), իսկ Strix տուփի հետ
երկսյունակ համեմատությունը՝
[այստեղ](https://agmind.ai/hy/reports/strix-halo-vs-dgx-spark/)։

## Ո՞ր տուփը որ workload-ի համար

Մեր սեփական չափումները՝ կարդացված որպես որոշում.

- **Մեկ օգտվող, չաթ և կոդի օգնություն** — 128 ԳԲ unified դասն այս ամենն
  անում է պաշարով։ Դրանից հետո եկող ընտրություններն ավելի կարևոր են, քան
  տուփը. [քվանտը](https://agmind.ai/hy/reports/q8-0-vs-q4-k-m-strix-halo/) և
  [backend-ը](https://agmind.ai/hy/compare/llamacpp-vulkan-vs-rocm-strix-halo/) մեր թվերը
  շարժեցին ավելի, քան կշարժեին թարմացման ծրագրերի մեծ մասը։
- **Փոքր թիմ՝ չաթաձև աշխատանքով** — նույն դասը. չափսավորիր
  զուգահեռության սանդուղքից, ոչ թե աշխատակիցների քանակից։
- **Փաստաթղթածանր աշխատանք** — կրկին նույն դասը, բայց պլանավորիր
  prefill-ի, ոչ թե դեկոդի շուրջ, և սեսիայի վերաօգտագործմանը վերաբերվիր
  որպես սարքաշարային մակարդակի օպտիմիզացիայի։
- **Բաց կշիռների ֆրոնտիր դասը** — մեկ տուփը դա չի անում։ Զույգն արեց՝
  կարաններով, և մենք հրապարակել ենք և՛ բաղադրատոմսը, և՛ թակարդները։
- **Ուշացման նկատմամբ կրիտիկական մեկհոսք աշխատանք ծանր prompt-երի վրա**
  — նախքան որևէ բան գնելը կարդա վերևի prefill-ի թվերը. հենց այստեղ է
  լոկալ սարքաշարն ամենից հաճախ հիասթափեցնում մարդկանց։

## Ինչ մենք ՉԵՆՔ չափել

Սա այն բաժինն է, որ մյուս բոլոր սարքաշարային ուղեցույցները բաց են
թողնում, և հենց դրա համար է մերը կարճ այնտեղ, որտեղ նրանցը վստահ է։

**Դիսկրետ GPU-ով build-եր։** Մեկ և երկու RTX դասի քարտ, օգտագործված
3090-ի հարցը, 5090-ի հարցը — դրանք գերիշխում են որոնման արդյունքներում,
և մենք դրանց մասին առաջնային տվյալ չունենք։ Մեր [ստենդը](https://agmind.ai/hy/testbed/)
հայտարարում է CUDA ուղի, բայց այն հրապարակված գործարկումներ չունի, ուստի
պնդում չենք անում։ Երբ գործարկվի, կհասնի հում գործարկումներով՝ ինչպես
մնացած ամեն ինչ։

**Apple Silicon։** Հայտարարված ուղի, զրո հրապարակված գործարկում, զրո
պնդում։

**Միայն CPU և փոքր VRAM-ով offload։** «Մոդելը չի տեղավորվում» ռեժիմն այս
սարքաշարային դասից ցածր ամենաշատ հարցվող և ամենաքիչ չափված հարցն է։
Մենք այն չենք գործարկել։

**Հոսանք և փող։** Գներ չենք հրապարակում — սարքաշարի գները շարժվում են, և
դրանք մեջբերող լաբորատորիան վատ է ծերանում։ Մեկ թոքենի հաշվով վատտերն իրական բաց են, որը մտադիր ենք փակել, հենց չափման մեթոդաբանությունը
կայունանա. մինչ այդ էլեկտրաէներգիայի թվեր նույնպես չունենք։

Եթե ուղեցույցը վստահորեն ծածկում է այս ամենը, ստուգիր՝ արդյոք դրանցից
գեթ մեկը չափել է։

## Ինչպե՞ս գնել՝ առանց որևէ մեկին վստահելու, ներառյալ մեզ

Որոշիր workload-ը, հետո ամեն կարդացած թվից պահանջիր. ինչ սարք և
firmware, runtime-ի ինչ build, մոդելի ինչ արտեֆակտ և քվանտ, ինչ prompt և
ելքի երկարություն, ինչ զուգահեռություն, լարի որ կողմը, քանի կրկնություն։
[Արձանագրությունը գրված է այստեղ](https://agmind.ai/hy/reports/how-to-benchmark-local-llm/),
[իսկ harness-ը հրապարակային է](https://github.com/botAGI/agmind-bench) —
մեր քշած սառեցված workload-ներն այն են, որ կարող ես գործարկել տուփի վրա
գնումից առաջ կամ հետո։

Մեկ տողով չափված պատասխան ունեցող հաճախակի հարցերն ինդեքսավորված են
[պատասխանների էջում](https://agmind.ai/hy/answers/). վերևի ամեն թիվ ունի մշտական էջ՝ իր
շրջանակով, սահմանափակումներով և հում ապացույցով,
[claim-երի ռեեստրում](https://agmind.ai/hy/claims/)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
