Короткий ответ из контролируемой ячейки: больший квант не купил ничего, что наши гейты качества смогли бы обнаружить, а декодирует медленнее. На этой коробке, на этих ворклоадах Q4_K_M выигрывает по обоим пунктам. Длинный ответ, с цифрами и их ограничениями, — ниже.
Каждое сообщество вокруг локальных LLM пересуживает этот спор еженедельно. Кто-то скачивает модель, видит шесть файлов квантов, спрашивает, какой брать, и получает стену уверенных ответов, подкреплённых таблицами перплексии с другого железа, других моделей — или вообще ничем. Чего в треде почти никогда нет, так это той же модели, измеренной на двух квантах на той же машине при заморозке всего остального. Это и есть эта страница.
Контролируемая ячейка
Один Beelink GTR9 Pro, Ryzen AI Max+ 395 со 128 ГБ unified-памяти. llama.cpp server, бэкенд Vulkan, сборка запинена по digest образа. Qwen3.6-35B-A3B из одного семейства артефактов, один раз в Q4_K_M и один раз в Q8_0, каждый запинен по хэшу. Одни ворклоады, одни гейты, по три повторных прогона, reasoning выключен. Квантизация — единственная переменная.
Q8_0 медленнее, чем Q4_K_M?
Темп декода — то, чем квант ощущается весь день, поэтому начнём с него. Q4_K_M идёт на 15.9мс/токенrepeated. Q8_0 на том же бэкенде — на 18.7мс/токенrepeated.
Более тяжёлые веса проталкивают через ту же шину памяти больше байтов на каждый токен, а на unified-memory-коробке шина и есть потолок. Платить это приходится на каждом токене каждого ответа, всегда. Оба темпа пригодны для одного читателя; разрыв реален и постоянен.
Отступление для любопытных до бэкендов: Q8_0 на Vulkan приземляется в тот же темп, что Q4_K_M на ROCm, 18.7мс/токенrepeated — неверно выбранный бэкенд стоит примерно столько же, сколько удвоение весов. Продолжение этой истории — в сравнении бэкендов.
Даёт ли Q8_0 качество лучше Q4_K_M?
На наших гейтах — ничего обнаружимого. Автоматизация со строгим JSON, ворклоад, где деградировавшие веса первым делом проявляются кривым выводом и неверными метками, прошла на 100.0% запросовrepeated на Q4_K_M и на 100.0% запросовrepeated на Q8_0. Одинаково. Гейты формата, языка и повторов на интерактивном корпусе — тоже без разницы.
Читайте этот клейм ровно так узко, как он написан. Наши гейты проверяют, парсится ли вывод, совпадает ли он с ground truth на закрытых наборах меток и держится ли в нужном языке без зацикливаний. Это не бенчмарк рассуждений и не проба знаний, а о тонких различиях качества, которые могла бы вскрыть длинная проза, они не говорят ничего. Что они устанавливают: на задачах с жёстким правильным ответом эта модель в Q4_K_M не оставила Q8_0 ничего выигрывать.
Какой квант брать: Q8_0 или Q4_K_M?
Решайте по тому, чего вам не хватает. Не хватает памяти — Q4_K_M, и это большинство. Артефакт Q8_0 заметно тяжелее на диске и в памяти, что на коробках поменьше решает вопрос раньше, чем качество получит слово, а даже на 128 ГБ может стать разницей между «вторая модель влезает рядом» и «не влезает». Не хватает терпения — снова Q4_K_M, и это неудобная находка. Дефолтный совет «гоняй самый большой квант, который влезает» тратит ваш темп декода на разницу в качестве, которую наши гейты с жёсткими ответами обнаружить не смогли. Если ваш ворклоад — длинная проза, где нюанс действительно может отличаться, прогоните свой корпус через оба кванта: харнесс открыт.
Чего это НЕ говорит
- Одно семейство моделей. Про MoE с малым активным набором принято считать, что они квантуются мягко; плотная модель может отблагодарить за Q8_0 иначе. Мы измерили эту модель и клеймим только её.
- Ни перплексии, ни accuracy-сьютов. Намеренно: эти цифры плохо переезжают между железом и токенизаторами. Задачные гейты с ground truth грубее — и честнее.
- Одна коробка, одна сборка. Форма разрыва в темпе должна держаться на любой упирающейся в пропускную способность unified-memory-машине; точные цифры — только про эту коробку.
Полная матрица с обоими квантами и обоими бэкендами — на странице сравнения, глубокий разбор взаимодействия «квант × бэкенд» — в отчёте про кванты и бэкенды. У каждой цифры выше есть постоянная страница со скоупом и сырыми прогонами: реестр клеймов.