# Вторая модель, второй квант, второй бэкенд: что переносится на одном ящике

> Тот же юнит Strix Halo, три замены по одной за раз: второе семейство моделей воспроизводит режим пустых ответов; Q8_0 не покупает ничего измеримого на этих ворклоадах; ROCm работает на gfx1151, но декодит медленнее Vulkan.

- Published: 2026-08-03
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/model-quant-backend-strix-halo/

> **Уровень доказательств: `lab_repeated`.** Каждая цифра заново выводится из
> сырых записей по запросам запросом, названным в реестре клеймов. По три
> повторных прогона на ячейку; менялась ровно одна переменная за раз против
> той же пиненной базы (Qwen3.6-35B Q4_K_M, llama.cpp Vulkan, один юнит
> GTR9 Pro).

## Зачем это исследование

Вердикт для одной конфигурации — не вердикт для её соседей. Здесь по одной
за раз заменяется ровно одна компонента идентичности — семейство модели,
квантизация, вычислительный бэкенд — и измеряется, что реально переносится.

## Замена 1: второе семейство моделей воспроизводит режим отказа

Наша прежняя находка: thinking-модель при тесном бюджете завершения
возвращает HTTP 200 с пустым ответом. На gemma-4-26B-A4B в дефолтном режиме
при бюджете 1024 токена
**8.3 % of requests** ([strix.gemma4.interactive2.c1.answerless-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.answerless-default/)) бытовых
запросов вернулись пустыми по той же причине — проход размышления съел
бюджет. Мягче, чем thinking-ячейка Qwen, но эффект есть: **режим отказа не
уникален для одного семейства моделей** — оба измеренных семейства его
показывают. Держится ли он на reasoning-моделях вообще — ровно то, что этот
корпус создан проверять дальше. Ответ и здесь отстаёт от потока: первый
токен потока приходит за
**282 ms** ([strix.gemma4.interactive2.c1.ttft-any-token](https://agmind.ai/claims/strix.gemma4.interactive2.c1.ttft-any-token/)), а первый
токен *ответа* — за
**10768 ms** ([strix.gemma4.interactive2.c1.ttfa-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.ttfa-default/)).

В остальном gemma — способный жилец того же ящика: поиск иголки
**95.8 % of requests** ([strix.gemma4.longctx.c1.needle-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.needle-success/)) по лестнице
2k–32k, task success строгого JSON
**93.8 % of requests** ([strix.gemma4.structured.c1.task-success](https://agmind.ai/claims/strix.gemma4.structured.c1.task-success/)) (провалы — это
нераспарсиваемые выводы на RU-задачах генерации, не ошибочные значения), но
на unanswerable-контролях явное признание отсутствия ответа она выдала в
**75.0 % of requests** ([strix.gemma4.longctx.c1.control-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.control-success/)) случаев.
Провалившаяся четверть кодов не выдумывала — те запросы вернули пустые
ответы: reasoning-проход съел весь токен-бюджет. Qwen3.6 ответил явным
отказом на каждый контроль.

## Замена 2: Q8_0 не купил ничего, что видят эти ворклоады

Артефакт Q8_0 на 35 ГБ против Q4_K_M на 20 ГБ, размышление выключено: task
success строгого JSON остался
**100.0 % of requests** ([strix.qwen36q8.vulkan.c1.task-success](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.task-success/)) — идентично
Q4_K_M — а декод замедлился с
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) до
**18.7 ms/token** ([strix.qwen36q8.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)) на токен,
упираясь в пропускную способность памяти, как и ожидается на unified
LPDDR5X. На этих ворклоадах больший квант — строго худшая сделка. Это
утверждение про эти гейты и корпуса: там, где корректность сложнее, чем
меряют наши гейты, разница в качестве вполне может существовать.

## Замена 3: ROCm работает на gfx1151 — но медленнее

Сборка ROCm завершила каждый запрос
(**100.0 % of requests** ([strix.qwen36q4.rocm.c1.task-success](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.task-success/)) на строгом JSON,
первый токен ответа
**215 ms** ([strix.qwen36q4.rocm.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.ttfa-nothink/))) — бэкенд
пригоден. Но декод шёл
**18.7 ms/token** ([strix.qwen36q4.rocm.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.itl-nothink/)) на токен против
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) у Vulkan —
сегодня Vulkan на этом ящике быстрее.

Направление сходится с более ранним одиночным smoke-проходом лаборатории по
тем же бэкендам (серверные timings, архив в smoke-датасете) — ячейки выше
превращают ту индикацию в подкреплённые реестром клиентские цифры с
повторами. Одиночные ad-hoc завершения не являются доказательством ни в
какую сторону; доказательство — только пакетированные прогоны.

## Чего это не устанавливает

Отключение размышления у gemma не проверялось (переключатель зависит от
chat template). Оба кванта упираются в потолок наших гейтов корректности —
более сложные задачи могли бы их разделить. Образ ROCm — плавающий
upstream-тег, здесь запинен своим digest. Замены 1–3 шли на одном юните;
репликация юнит-к-юниту есть только у базовой конфигурации. Ничто здесь не
сравнивает Strix Halo с другими устройствами.

## Доказательства

Каждый прогон отдал стандартный пакет (манифест, записи по каждому запросу
включая отказы, исходы гейтов, лог runtime, контрольные суммы); цифры выше
заново выводятся из этих записей в CI. Харнесс и корпуса:
[agmind-bench](https://github.com/botAGI/agmind-bench).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
