# Q8_0 или Q4_K_M? Что на самом деле покупает больший квант — измерено на одной коробке

> Та же модель, та же сборка llama.cpp, та же коробка на Strix Halo, менялась только квантизация: чего Q8_0 стоит в темпе декода против Q4_K_M, что увидели наши гейты качества и какой дефицит на самом деле должен решать выбор.

- Published: 2026-08-16
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/q8-0-vs-q4-k-m-strix-halo/

Короткий ответ из контролируемой ячейки: больший квант не купил ничего,
что наши гейты качества смогли бы обнаружить, а декодирует медленнее. На
этой коробке, на этих ворклоадах Q4_K_M выигрывает по обоим пунктам.
Длинный ответ, с цифрами и их ограничениями, — ниже.

Каждое сообщество вокруг локальных LLM пересуживает этот спор еженедельно.
Кто-то скачивает модель, видит шесть файлов квантов, спрашивает, какой брать,
и получает стену уверенных ответов, подкреплённых таблицами перплексии с
другого железа, других моделей — или вообще ничем. Чего в треде почти никогда
нет, так это той же модели, измеренной на двух квантах на той же машине при
заморозке всего остального. Это и есть эта страница.

## Контролируемая ячейка

Один Beelink GTR9 Pro, Ryzen AI Max+ 395 со 128 ГБ unified-памяти. llama.cpp
server, бэкенд Vulkan, сборка запинена по digest образа. Qwen3.6-35B-A3B из
одного семейства артефактов, один раз в Q4_K_M и один раз в Q8_0, каждый
запинен по хэшу. Одни ворклоады, одни гейты, по три повторных прогона,
reasoning выключен. Квантизация — единственная переменная.

## Q8_0 медленнее, чем Q4_K_M?

Темп декода — то, чем квант ощущается весь день, поэтому начнём с него.
Q4_K_M идёт на **15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)).
Q8_0 на том же бэкенде — на
**18.7 ms/token** ([strix.qwen36q8.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)).

Более тяжёлые веса проталкивают через ту же шину памяти больше байтов на
каждый токен, а на unified-memory-коробке шина и есть потолок. Платить это
приходится на каждом токене каждого ответа, всегда. Оба темпа пригодны для
одного читателя; разрыв реален и постоянен.

Отступление для любопытных до бэкендов: Q8_0 на Vulkan приземляется в тот же
темп, что Q4_K_M на ROCm,
**18.7 ms/token** ([strix.qwen36q4.rocm.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.itl-nothink/)) — неверно выбранный
бэкенд стоит примерно столько же, сколько удвоение весов. Продолжение этой
истории — в [сравнении бэкендов](https://agmind.ai/ru/compare/llamacpp-vulkan-vs-rocm-strix-halo/).

## Даёт ли Q8_0 качество лучше Q4_K_M?

На наших гейтах — ничего обнаружимого. Автоматизация со строгим JSON,
ворклоад, где деградировавшие веса первым делом проявляются кривым выводом и
неверными метками, прошла на
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/)) на
Q4_K_M и на **100.0 % of requests** ([strix.qwen36q8.vulkan.c1.task-success](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.task-success/)) на
Q8_0. Одинаково. Гейты формата, языка и повторов на интерактивном корпусе —
тоже без разницы.

Читайте этот клейм ровно так узко, как он написан. Наши гейты проверяют,
парсится ли вывод, совпадает ли он с ground truth на закрытых наборах меток и
держится ли в нужном языке без зацикливаний. Это не бенчмарк рассуждений и не
проба знаний, а о тонких различиях качества, которые могла бы вскрыть длинная
проза, они не говорят ничего. Что они устанавливают: на задачах с жёстким
правильным ответом эта модель в Q4_K_M не оставила Q8_0 ничего выигрывать.

## Какой квант брать: Q8_0 или Q4_K_M?

Решайте по тому, чего вам не хватает. Не хватает памяти — Q4_K_M, и это
большинство. Артефакт Q8_0 заметно тяжелее на диске и в памяти, что на
коробках поменьше решает вопрос раньше, чем качество получит слово, а даже на
128 ГБ может стать разницей между «вторая модель влезает рядом» и «не
влезает».
Не хватает терпения — снова Q4_K_M, и это неудобная находка. Дефолтный совет
«гоняй самый большой квант, который влезает» тратит ваш темп декода на
разницу в качестве, которую наши гейты с жёсткими ответами обнаружить не
смогли. Если ваш ворклоад — длинная проза, где нюанс действительно может
отличаться, прогоните свой корпус через оба кванта:
[харнесс открыт](https://github.com/botAGI/agmind-bench).

## Чего это НЕ говорит

- **Одно семейство моделей.** Про MoE с малым активным набором принято
  считать, что они квантуются мягко; плотная модель может отблагодарить за
  Q8_0 иначе. Мы измерили эту модель и клеймим только её.
- **Ни перплексии, ни accuracy-сьютов.** Намеренно: эти цифры плохо
  переезжают между железом и токенизаторами. Задачные гейты с ground truth
  грубее — и честнее.
- **Одна коробка, одна сборка.** Форма разрыва в темпе должна держаться на
  любой упирающейся в пропускную способность unified-memory-машине; точные
  цифры — только про эту коробку.

Полная матрица с обоими квантами и обоими бэкендами — на
[странице сравнения](https://agmind.ai/ru/compare/q4km-vs-q80-qwen36-strix-halo/), глубокий
разбор взаимодействия «квант × бэкенд» — в
[отчёте про кванты и бэкенды](https://agmind.ai/ru/reports/model-quant-backend-strix-halo/).
У каждой цифры выше есть постоянная страница со скоупом и сырыми прогонами:
[реестр клеймов](https://agmind.ai/ru/claims/).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
