Отчёт

Q8_0 или Q4_K_M? Что на самом деле покупает больший квант — измерено на одной коробке

Та же модель, та же сборка llama.cpp, та же коробка на Strix Halo, менялась только квантизация: чего Q8_0 стоит в темпе декода против Q4_K_M, что увидели наши гейты качества и какой дефицит на самом деле должен решать выбор.

lab_repeated internal research 16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Короткий ответ из контролируемой ячейки: больший квант не купил ничего, что наши гейты качества смогли бы обнаружить, а декодирует медленнее. На этой коробке, на этих ворклоадах Q4_K_M выигрывает по обоим пунктам. Длинный ответ, с цифрами и их ограничениями, — ниже.

Каждое сообщество вокруг локальных LLM пересуживает этот спор еженедельно. Кто-то скачивает модель, видит шесть файлов квантов, спрашивает, какой брать, и получает стену уверенных ответов, подкреплённых таблицами перплексии с другого железа, других моделей — или вообще ничем. Чего в треде почти никогда нет, так это той же модели, измеренной на двух квантах на той же машине при заморозке всего остального. Это и есть эта страница.

Контролируемая ячейка

Один Beelink GTR9 Pro, Ryzen AI Max+ 395 со 128 ГБ unified-памяти. llama.cpp server, бэкенд Vulkan, сборка запинена по digest образа. Qwen3.6-35B-A3B из одного семейства артефактов, один раз в Q4_K_M и один раз в Q8_0, каждый запинен по хэшу. Одни ворклоады, одни гейты, по три повторных прогона, reasoning выключен. Квантизация — единственная переменная.

Q8_0 медленнее, чем Q4_K_M?

Темп декода — то, чем квант ощущается весь день, поэтому начнём с него. Q4_K_M идёт на 15.9мс/токенrepeated. Q8_0 на том же бэкенде — на 18.7мс/токенrepeated.

Более тяжёлые веса проталкивают через ту же шину памяти больше байтов на каждый токен, а на unified-memory-коробке шина и есть потолок. Платить это приходится на каждом токене каждого ответа, всегда. Оба темпа пригодны для одного читателя; разрыв реален и постоянен.

Отступление для любопытных до бэкендов: Q8_0 на Vulkan приземляется в тот же темп, что Q4_K_M на ROCm, 18.7мс/токенrepeated — неверно выбранный бэкенд стоит примерно столько же, сколько удвоение весов. Продолжение этой истории — в сравнении бэкендов.

Даёт ли Q8_0 качество лучше Q4_K_M?

На наших гейтах — ничего обнаружимого. Автоматизация со строгим JSON, ворклоад, где деградировавшие веса первым делом проявляются кривым выводом и неверными метками, прошла на 100.0% запросовrepeated на Q4_K_M и на 100.0% запросовrepeated на Q8_0. Одинаково. Гейты формата, языка и повторов на интерактивном корпусе — тоже без разницы.

Читайте этот клейм ровно так узко, как он написан. Наши гейты проверяют, парсится ли вывод, совпадает ли он с ground truth на закрытых наборах меток и держится ли в нужном языке без зацикливаний. Это не бенчмарк рассуждений и не проба знаний, а о тонких различиях качества, которые могла бы вскрыть длинная проза, они не говорят ничего. Что они устанавливают: на задачах с жёстким правильным ответом эта модель в Q4_K_M не оставила Q8_0 ничего выигрывать.

Какой квант брать: Q8_0 или Q4_K_M?

Решайте по тому, чего вам не хватает. Не хватает памяти — Q4_K_M, и это большинство. Артефакт Q8_0 заметно тяжелее на диске и в памяти, что на коробках поменьше решает вопрос раньше, чем качество получит слово, а даже на 128 ГБ может стать разницей между «вторая модель влезает рядом» и «не влезает». Не хватает терпения — снова Q4_K_M, и это неудобная находка. Дефолтный совет «гоняй самый большой квант, который влезает» тратит ваш темп декода на разницу в качестве, которую наши гейты с жёсткими ответами обнаружить не смогли. Если ваш ворклоад — длинная проза, где нюанс действительно может отличаться, прогоните свой корпус через оба кванта: харнесс открыт.

Чего это НЕ говорит

Полная матрица с обоими квантами и обоими бэкендами — на странице сравнения, глубокий разбор взаимодействия «квант × бэкенд» — в отчёте про кванты и бэкенды. У каждой цифры выше есть постоянная страница со скоупом и сырыми прогонами: реестр клеймов.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-16). Q8_0 или Q4_K_M? Что на самом деле покупает больший квант — измерено на одной коробке. Evidence level: lab_repeated. https://agmind.ai/ru/reports/q8-0-vs-q4-k-m-strix-halo/
← Отчёты