Отчёт

Вторая модель, второй квант, второй бэкенд: что переносится на одном ящике

Тот же юнит Strix Halo, три замены по одной за раз: второе семейство моделей воспроизводит режим пустых ответов; Q8_0 не покупает ничего измеримого на этих ворклоадах; ROCm работает на gfx1151, но декодит медленнее Vulkan.

lab_repeated internal research 3 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Уровень доказательств: lab_repeated. Каждая цифра заново выводится из сырых записей по запросам запросом, названным в реестре клеймов. По три повторных прогона на ячейку; менялась ровно одна переменная за раз против той же пиненной базы (Qwen3.6-35B Q4_K_M, llama.cpp Vulkan, один юнит GTR9 Pro).

Зачем это исследование

Вердикт для одной конфигурации — не вердикт для её соседей. Здесь по одной за раз заменяется ровно одна компонента идентичности — семейство модели, квантизация, вычислительный бэкенд — и измеряется, что реально переносится.

Замена 1: второе семейство моделей воспроизводит режим отказа

Наша прежняя находка: thinking-модель при тесном бюджете завершения возвращает HTTP 200 с пустым ответом. На gemma-4-26B-A4B в дефолтном режиме при бюджете 1024 токена 8.3% запросовrepeated бытовых запросов вернулись пустыми по той же причине — проход размышления съел бюджет. Мягче, чем thinking-ячейка Qwen, но эффект есть: режим отказа не уникален для одного семейства моделей — оба измеренных семейства его показывают. Держится ли он на reasoning-моделях вообще — ровно то, что этот корпус создан проверять дальше. Ответ и здесь отстаёт от потока: первый токен потока приходит за 282мсrepeated, а первый токен ответа — за 10768мсrepeated.

В остальном gemma — способный жилец того же ящика: поиск иголки 95.8% запросовrepeated по лестнице 2k–32k, task success строгого JSON 93.8% запросовrepeated (провалы — это нераспарсиваемые выводы на RU-задачах генерации, не ошибочные значения), но на unanswerable-контролях явное признание отсутствия ответа она выдала в 75.0% запросовrepeated случаев. Провалившаяся четверть кодов не выдумывала — те запросы вернули пустые ответы: reasoning-проход съел весь токен-бюджет. Qwen3.6 ответил явным отказом на каждый контроль.

Замена 2: Q8_0 не купил ничего, что видят эти ворклоады

Артефакт Q8_0 на 35 ГБ против Q4_K_M на 20 ГБ, размышление выключено: task success строгого JSON остался 100.0% запросовrepeated — идентично Q4_K_M — а декод замедлился с 15.9мс/токенrepeated до 18.7мс/токенrepeated на токен, упираясь в пропускную способность памяти, как и ожидается на unified LPDDR5X. На этих ворклоадах больший квант — строго худшая сделка. Это утверждение про эти гейты и корпуса: там, где корректность сложнее, чем меряют наши гейты, разница в качестве вполне может существовать.

Замена 3: ROCm работает на gfx1151 — но медленнее

Сборка ROCm завершила каждый запрос (100.0% запросовrepeated на строгом JSON, первый токен ответа 215мсrepeated) — бэкенд пригоден. Но декод шёл 18.7мс/токенrepeated на токен против 15.9мс/токенrepeated у Vulkan — сегодня Vulkan на этом ящике быстрее.

Направление сходится с более ранним одиночным smoke-проходом лаборатории по тем же бэкендам (серверные timings, архив в smoke-датасете) — ячейки выше превращают ту индикацию в подкреплённые реестром клиентские цифры с повторами. Одиночные ad-hoc завершения не являются доказательством ни в какую сторону; доказательство — только пакетированные прогоны.

Чего это не устанавливает

Отключение размышления у gemma не проверялось (переключатель зависит от chat template). Оба кванта упираются в потолок наших гейтов корректности — более сложные задачи могли бы их разделить. Образ ROCm — плавающий upstream-тег, здесь запинен своим digest. Замены 1–3 шли на одном юните; репликация юнит-к-юниту есть только у базовой конфигурации. Ничто здесь не сравнивает Strix Halo с другими устройствами.

Доказательства

Каждый прогон отдал стандартный пакет (манифест, записи по каждому запросу включая отказы, исходы гейтов, лог runtime, контрольные суммы); цифры выше заново выводятся из этих записей в CI. Харнесс и корпуса: agmind-bench.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-03). Вторая модель, второй квант, второй бэкенд: что переносится на одном ящике. Evidence level: lab_repeated. https://agmind.ai/ru/reports/model-quant-backend-strix-halo/
← Отчёты