Уровень доказательств:
lab_repeated. Каждая цифра заново выводится из сырых записей по запросам запросом, названным в реестре клеймов. По три повторных прогона на ячейку; менялась ровно одна переменная за раз против той же пиненной базы (Qwen3.6-35B Q4_K_M, llama.cpp Vulkan, один юнит GTR9 Pro).
Зачем это исследование
Вердикт для одной конфигурации — не вердикт для её соседей. Здесь по одной за раз заменяется ровно одна компонента идентичности — семейство модели, квантизация, вычислительный бэкенд — и измеряется, что реально переносится.
Замена 1: второе семейство моделей воспроизводит режим отказа
Наша прежняя находка: thinking-модель при тесном бюджете завершения возвращает HTTP 200 с пустым ответом. На gemma-4-26B-A4B в дефолтном режиме при бюджете 1024 токена 8.3% запросовrepeated бытовых запросов вернулись пустыми по той же причине — проход размышления съел бюджет. Мягче, чем thinking-ячейка Qwen, но эффект есть: режим отказа не уникален для одного семейства моделей — оба измеренных семейства его показывают. Держится ли он на reasoning-моделях вообще — ровно то, что этот корпус создан проверять дальше. Ответ и здесь отстаёт от потока: первый токен потока приходит за 282мсrepeated, а первый токен ответа — за 10768мсrepeated.
В остальном gemma — способный жилец того же ящика: поиск иголки 95.8% запросовrepeated по лестнице 2k–32k, task success строгого JSON 93.8% запросовrepeated (провалы — это нераспарсиваемые выводы на RU-задачах генерации, не ошибочные значения), но на unanswerable-контролях явное признание отсутствия ответа она выдала в 75.0% запросовrepeated случаев. Провалившаяся четверть кодов не выдумывала — те запросы вернули пустые ответы: reasoning-проход съел весь токен-бюджет. Qwen3.6 ответил явным отказом на каждый контроль.
Замена 2: Q8_0 не купил ничего, что видят эти ворклоады
Артефакт Q8_0 на 35 ГБ против Q4_K_M на 20 ГБ, размышление выключено: task success строгого JSON остался 100.0% запросовrepeated — идентично Q4_K_M — а декод замедлился с 15.9мс/токенrepeated до 18.7мс/токенrepeated на токен, упираясь в пропускную способность памяти, как и ожидается на unified LPDDR5X. На этих ворклоадах больший квант — строго худшая сделка. Это утверждение про эти гейты и корпуса: там, где корректность сложнее, чем меряют наши гейты, разница в качестве вполне может существовать.
Замена 3: ROCm работает на gfx1151 — но медленнее
Сборка ROCm завершила каждый запрос (100.0% запросовrepeated на строгом JSON, первый токен ответа 215мсrepeated) — бэкенд пригоден. Но декод шёл 18.7мс/токенrepeated на токен против 15.9мс/токенrepeated у Vulkan — сегодня Vulkan на этом ящике быстрее.
Направление сходится с более ранним одиночным smoke-проходом лаборатории по тем же бэкендам (серверные timings, архив в smoke-датасете) — ячейки выше превращают ту индикацию в подкреплённые реестром клиентские цифры с повторами. Одиночные ad-hoc завершения не являются доказательством ни в какую сторону; доказательство — только пакетированные прогоны.
Чего это не устанавливает
Отключение размышления у gemma не проверялось (переключатель зависит от chat template). Оба кванта упираются в потолок наших гейтов корректности — более сложные задачи могли бы их разделить. Образ ROCm — плавающий upstream-тег, здесь запинен своим digest. Замены 1–3 шли на одном юните; репликация юнит-к-юниту есть только у базовой конфигурации. Ничто здесь не сравнивает Strix Halo с другими устройствами.
Доказательства
Каждый прогон отдал стандартный пакет (манифест, записи по каждому запросу включая отказы, исходы гейтов, лог runtime, контрольные суммы); цифры выше заново выводятся из этих записей в CI. Харнесс и корпуса: agmind-bench.