Контролируемое сравнение
Q4_K_M против Q8_0: покупает ли больший квант хоть что-то?
Стоит ли тратить лишнюю память на Q8_0-артефакт Qwen3.6-35B-A3B для чата и JSON-автоматизации на Strix Halo?
Что было зафиксировано
Один юнит, одна сборка Vulkan-бэкенда, одни замороженные корпуса, один поток, reasoning выключен. Отличается только артефакт модели (оба запинены хэшами).
| Метрика | Q4_K_M (20 ГБ) | Q8_0 (35 ГБ) |
|---|---|---|
| Межтокенная задержка, медиана (темп декода) | 15.9мс/токенmedian over valid requests · lab_repeated · доказательства | 18.7мс/токенmedian over valid requests · lab_repeated · доказательства |
| Успех strict-JSON задач | 100.0% запросовshare of all issued requests · lab_repeated · доказательства | 100.0% запросовshare of all issued requests · lab_repeated · доказательства |
Как это читать
На ворклоадах, которые видят эти гейты, больший артефакт не купил ничего: успех задач идентичен, а декод у Q8_0 медленнее. Если ваша нагрузка похожа на эти — повседневный чат и strict-JSON извлечение — память полезнее потратить на контекст.
Ограничения
Гейты качества здесь — классы формата/JSON/повторов; разница квантов могла бы проявиться на более сложном reasoning или многоязычной генерации, которые эти ворклоады не зондируют. Отрицательный результат, ограниченный измеренным.
Отвечаете на этот вопрос где-то? Вставьте таблицу
Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.