# Q8_0, թե՞ Q4_K_M. ինչ է ավելի մեծ քվանտն իրականում տալիս՝ չափված մեկ տուփի վրա

> Նույն մոդելը, նույն llama.cpp build-ը, նույն Strix Halo տուփը, փոխվել է միայն քվանտավորումը. ինչ է Q8_0-ն արժենում դեկոդի տեմպով Q4_K_M-ի դիմաց, ինչ տեսան մեր որակի gate-երը, և որ պակասը պետք է իրականում որոշի ընտրությունը։

- Published: 2026-08-16
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/q8-0-vs-q4-k-m-strix-halo/

Կարճ պատասխանը վերահսկվող բջիջից. ավելի մեծ քվանտը ոչինչ չգնեց, որ մեր
որակի gate-երը կարողանային նկատել, իսկ դեկոդում է ավելի դանդաղ։ Այս տուփի
վրա, այս workload-ների համար Q4_K_M-ը հաղթում է երկու հաշվով էլ։ Երկար
պատասխանը՝ թվերով և դրանց սահմաններով, ստորև է։

Ամեն լոկալ LLM համայնք այս վեճը շաբաթը մեկ նորից է բացում։ Ինչ-որ մեկը
ներբեռնում է մոդել, տեսնում է վեց քվանտ-ֆայլ, հարցնում է՝ ո՞րը, և ստանում
ինքնավստահ պատասխանների պատ՝ հենված այլ սարքաշարից, այլ մոդելներից քաղված
perplexity-աղյուսակների վրա — կամ ոչնչի։ Ինչ թելը գրեթե երբեք չի
պարունակում՝ նույն մոդելը, չափված երկու քվանտով նույն մեքենայի վրա, երբ
մնացած ամեն ինչ սառեցված է։ Հենց դա է այս էջը։

## Վերահսկվող բջիջը

Մեկ Beelink GTR9 Pro, Ryzen AI Max+ 395՝ 128 ԳԲ unified հիշողությամբ։
llama.cpp server, Vulkan backend, build-ն ամրագրված image-ի digest-ով։
Qwen3.6-35B-A3B նույն արտեֆակտային ընտանիքից՝ մեկ անգամ Q4_K_M, մեկ անգամ
Q8_0, յուրաքանչյուրն ամրագրված հեշով։ Նույն workload-ները, նույն gate-երը,
երեքական կրկնված անցում, reasoning-ն անջատած։ Քվանտավորումը միակ
փոփոխականն է։

## Q8_0-ն ավելի դանդա՞ղ է, քան Q4_K_M-ը

Դեկոդի տեմպն այն է, որտեղ քվանտը զգացվում է ամբողջ օրը, ուստի սկսենք
այնտեղից։ Q4_K_M-ն ընթանում է
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ով։ Q8_0-ն նույն
backend-ի վրա՝ **18.7 ms/token** ([strix.qwen36q8.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.itl-nothink/))-ով։

Ավելի մեծ կշիռներն ամեն թոքենի համար նույն հիշողության միջով ավելի շատ
բայթ են մղում, իսկ unified-memory տուփի վրա հիշողության թողունակությունն է
առաստաղը։ Դուք դա վճարում եք ամեն պատասխանի ամեն թոքենի վրա, ընդմիշտ։
Երկու տեմպն էլ պիտանի են մեկ ընթերցողի համար; ճեղքն իրական է և մշտական։

Կողմնակի դիտարկում backend-ներով հետաքրքրվողների համար. Q8_0-ն Vulkan-ի
վրա ընկնում է նույն տեմպի վրա, ինչ Q4_K_M-ը ROCm-ի վրա՝
**18.7 ms/token** ([strix.qwen36q4.rocm.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.itl-nothink/)), — սխալ backend
ընտրելն արժե մոտավորապես նույնքան, որքան կշիռների կրկնապատկումը։ Այդ
պատմությունը շարունակվում է
[backend-ների համեմատության մեջ](https://agmind.ai/hy/compare/llamacpp-vulkan-vs-rocm-strix-halo/)։

## Q8_0-ն որակով գերազանցո՞ւմ է Q4_K_M-ին

Մեր gate-երի վրա՝ ոչինչ նկատելի։ Խիստ JSON ավտոմատացումը — workload-ը,
որտեղ դեգրադացված կշիռներն առաջինը երևում են որպես չպարսվող ելք և սխալ
պիտակներ — անցավ
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/))-ով
Q4_K_M-ի վրա և
**100.0 % of requests** ([strix.qwen36q8.vulkan.c1.task-success](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.task-success/))-ով Q8_0-ի վրա։
Նույնական։ Ֆորմատի, լեզվի և կրկնությունների gate-երն ինտերակտիվ կորպուսի
վրա. նույնպես ոչ մի տարբերություն։

Կարդացեք այդ պնդումն այնքան նեղ, որքան այն գրված է։ Մեր gate-երը ստուգում
են՝ ելքը պարսվո՞ւմ է, համընկնո՞ւմ է ground truth-ի հետ փակ պիտակների
բազմությունների վրա, մնո՞ւմ է ճիշտ լեզվի մեջ առանց ցիկլերի։ Դրանք
reasoning-բենչմարք չեն, գիտելիքի զոնդ չեն, և ոչինչ չեն ասում որակի այն
նուրբ տարբերությունների մասին, որ երկար արձակը կարող էր ի հայտ բերել։ Ինչ
դրանք հաստատում են. կոշտ ճիշտ պատասխան ունեցող խնդիրների վրա այս մոդելը
Q4_K_M-ում Q8_0-ին հաղթելու ոչինչ չթողեց։

## Ո՞ր քվանտն ընտրել՝ Q8_0, թե՞ Q4_K_M

Որոշեք ըստ այն բանի, ինչի պակաս ունեք։ Հիշողության պակաս՝ Q4_K_M, և սա
մարդկանց մեծ մասն է։ Q8_0 արտեֆակտը դիսկի վրա և հիշողության մեջ էապես
ավելի ծանր է, ինչը փոքր տուփերի վրա հարցը փակում է դեռ նախքան որակը ձայն
կստանա, և նույնիսկ 128 ԳԲ-ի դեպքում կարող է որոշել՝ կողքին երկրորդ մոդել
կտեղավորվի՞, թե՞ ոչ։
Համբերության պակաս՝ կրկին Q4_K_M, և սա անհարմար գտածոն է։ «Գործարկիր
ամենամեծ քվանտը, որը տեղավորվում է» լռելյայն խորհուրդը ձեր դեկոդի տեմպը
ծախսում է որակի մի տարբերության վրա, որը մեր կոշտ պատասխանով gate-երը
չկարողացան նկատել։ Եթե ձեր workload-ը երկար արձակ է, որտեղ նրբերանգն իրոք
կարող է տարբեր լինել, երկուսի միջով անցկացրեք ձեր սեփական կորպուսը —
[harness-ը բաց է](https://github.com/botAGI/agmind-bench)։

## Ինչ սա ՉԻ ասում

- **Մեկ մոդելային ընտանիք։** Փոքր ակտիվ բազմությամբ MoE մոդելները լայնորեն
  համարվում են նրբանկատորեն քվանտավորվող; խիտ մոդելը Q8_0-ի համար կարող է
  այլ կերպ հատուցել։ Չափել ենք այս մոդելը և պնդում ենք միայն նրա մասին։
- **Ոչ perplexity, ոչ accuracy-փաթեթներ։** Միտումնավոր. այդ թվերը վատ են
  ճամփորդում սարքաշարերի ու թոքենայզերների միջով։ Ground truth-ով
  խնդիր-gate-երն ավելի կոպիտ են և ավելի ազնիվ։
- **Մեկ տուփ, մեկ build։** Տեմպի ճեղքի ձևը պետք է պահպանվի թողունակությամբ
  սահմանափակված ցանկացած unified-memory մեքենայի վրա; ճշգրիտ թվերը միայն
  այս տուփինն են։

Ամբողջական մատրիցը երկու քվանտով և երկու backend-ով՝
[համեմատության էջում](https://agmind.ai/hy/compare/q4km-vs-q80-qwen36-strix-halo/), քվանտ ×
backend փոխազդեցության խորը վերլուծությունը՝
[քվանտի և backend-ի հաշվետվության մեջ](https://agmind.ai/hy/reports/model-quant-backend-strix-halo/)։
Վերևի ամեն թիվ ունի մշտական էջ՝ շրջանակով և հում գործարկումներով.
[claim-երի ռեեստրը](https://agmind.ai/hy/claims/)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
