Контролируемое сравнение

Q4_K_M против Q8_0: покупает ли больший квант хоть что-то?

Стоит ли тратить лишнюю память на Q8_0-артефакт Qwen3.6-35B-A3B для чата и JSON-автоматизации на Strix Halo?

Что было зафиксировано

Один юнит, одна сборка Vulkan-бэкенда, одни замороженные корпуса, один поток, reasoning выключен. Отличается только артефакт модели (оба запинены хэшами).

Метрика Q4_K_M (20 ГБ) Q8_0 (35 ГБ)
Межтокенная задержка, медиана (темп декода) 15.9мс/токенmedian over valid requests · lab_repeated · доказательства 18.7мс/токенmedian over valid requests · lab_repeated · доказательства
Успех strict-JSON задач 100.0% запросовshare of all issued requests · lab_repeated · доказательства 100.0% запросовshare of all issued requests · lab_repeated · доказательства

Как это читать

На ворклоадах, которые видят эти гейты, больший артефакт не купил ничего: успех задач идентичен, а декод у Q8_0 медленнее. Если ваша нагрузка похожа на эти — повседневный чат и strict-JSON извлечение — память полезнее потратить на контекст.

Ограничения

Гейты качества здесь — классы формата/JSON/повторов; разница квантов могла бы проявиться на более сложном reasoning или многоязычной генерации, которые эти ворклоады не зондируют. Отрицательный результат, ограниченный измеренным.

Отвечаете на этот вопрос где-то? Вставьте таблицу

Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.

Связанные доказательства

← Все сравнения