# Q4_K_M-ն ընդդեմ Q8_0-ի. ավելի մեծ քվանտն որևէ բա՞ն է գնում։

Արժե՞ արդյոք ծախսել լրացուցիչ հիշողությունը Qwen3.6-35B-A3B-ի Q8_0 արտեֆակտի վրա չաթի և JSON-ավտոմատացման համար Strix Halo-ի վրա։

Այն workload-ների վրա, որոնք տեսնում են այս gate-երը, ավելի մեծ արտեֆակտն ոչինչ չգնեց. խնդիրների հաջողությունը նույնական է, իսկ Q8_0-ի դեկոդն ավելի դանդաղ է։ Եթե ձեր բեռը նման է սրանց, հիշողությունն ավելի օգտակար է ծախսել կոնտեքստի վրա։

**Ինչն էր ֆիքսված։** Նույն յունիթը, Vulkan backend-ի նույն build-ը, նույն սառեցված կորպուսները, մեկ հոսք, reasoning-ն անջատած։ Տարբերվում է միայն մոդելի արտեֆակտը (երկուսն էլ ամրագրված են հեշերով)։

| Մետրիկա | Q4_K_M (20 ԳԲ) | Q8_0 (35 ԳԲ) |
| --- | --- | --- |
| Միջթոքենային ուշացում, մեդիան (դեկոդի տեմպ) | 15.9 ms/token ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) | 18.7 ms/token ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)) |
| Strict-JSON խնդիրների հաջողություն | 100.0 % of requests ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.structured.c1.task-success-nothink/)) | 100.0 % of requests ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36q8.vulkan.c1.task-success/)) |

## Սահմանափակումներ

Որակի gate-երն այստեղ ֆորմատի/JSON-ի/կրկնությունների դասերն են. քվանտների տարբերությունը կարող էր երևալ ավելի բարդ reasoning-ի կամ բազմալեզու գեներացիայի վրա, որոնք այս workload-ները չեն զոնդավորում։ Բացասական արդյունք՝ սահմանափակված չափվածով։

## Առնչվող ապացույցներ

- https://agmind.ai/hy/reports/q8-0-vs-q4-k-m-strix-halo/
- https://agmind.ai/hy/reports/model-quant-backend-strix-halo/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/hy/compare/q4km-vs-q80-qwen36-strix-halo/
