# Q4_K_M против Q8_0: покупает ли больший квант хоть что-то?

Стоит ли тратить лишнюю память на Q8_0-артефакт Qwen3.6-35B-A3B для чата и JSON-автоматизации на Strix Halo?

На ворклоадах, которые видят эти гейты, больший артефакт не купил ничего: успех задач идентичен, а декод у Q8_0 медленнее. Если ваша нагрузка похожа на эти — повседневный чат и strict-JSON извлечение — память полезнее потратить на контекст.

**Что было зафиксировано.** Один юнит, одна сборка Vulkan-бэкенда, одни замороженные корпуса, один поток, reasoning выключен. Отличается только артефакт модели (оба запинены хэшами).

| Метрика | Q4_K_M (20 ГБ) | Q8_0 (35 ГБ) |
| --- | --- | --- |
| Межтокенная задержка, медиана (темп декода) | 15.9 ms/token ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) | 18.7 ms/token ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)) |
| Успех strict-JSON задач | 100.0 % of requests ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.structured.c1.task-success-nothink/)) | 100.0 % of requests ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q8.vulkan.c1.task-success/)) |

## Ограничения

Гейты качества здесь — классы формата/JSON/повторов; разница квантов могла бы проявиться на более сложном reasoning или многоязычной генерации, которые эти ворклоады не зондируют. Отрицательный результат, ограниченный измеренным.

## Связанные доказательства

- https://agmind.ai/ru/reports/q8-0-vs-q4-k-m-strix-halo/
- https://agmind.ai/ru/reports/model-quant-backend-strix-halo/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/ru/compare/q4km-vs-q80-qwen36-strix-halo/
