Проверенная конфигурация

Strix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — бытовой ассистент

Однопользовательский бытовой чат на Beelink GTR9 Pro: мгновенные ответы без размышления, сломанная конфигурация на дефолтном бюджете размышления и лимит многословности, который не проходится ни в одном режиме.

PARTIAL active lab_repeated

Точный отпечаток конфигурации

СистемаBeelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified — однопользовательские ячейки реплицированы на втором коммерчески идентичном юните
Runtimellama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
МодельQwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
Workloadinteractive-assistant-v2 @ 2026-08-02 — 16 бытовых задач, EN+RU
Режимinternal research
ФинансированиеСобственное финансирование, внутреннее исследование

Вердикт относится только к точной конфигурации и ревизии workload выше. Он не означает поддержку других версий прошивки, драйвера, runtime или модели того же устройства.

На какой вопрос отвечает карточка

Отзывчив ли однопользовательский стриминговый чат на этой точной конфигурации для повседневных человеческих задач — сообщений, писем, объяснений ребёнку, планов?

Вердикт: PARTIAL. Конфигурация чисто проходит в одном режиме работы, структурно падает в другом, и один гейт качества не проходится полностью ни в одном режиме. Детали — это и есть продукт; вот они.

Что проходит

С отключённым через chat template блоком размышления первый токен ответа приходит с медианой 210мсunit_replicated — ответ начинается вместе с потоком, а доля завершившихся ответом запросов в шести повторных прогонах на двух юнитах — 100.0% запросовunit_replicated, при пройденных гейтах языка и повторов.

Что падает

С включённым размышлением при бюджете 1024 токена 58.3% запросовunit_replicated бытовых запросов вернули HTTP 200 с пустым ответом: проход размышления съел весь бюджет до начала ответа. Приложение, проверяющее коды статуса, записывает их в успехи.

Поднятие бюджета до 4096 токенов убирает пустые ответы, но первый токен ответа тогда приходит с медианой 20191мсunit_replicated — десятки секунд видимого «размышления» перед ответом на запрос вида «напиши соседке сообщение из двух предложений».

При этом конвенциональный time-to-first-token равен 212мсunit_replicated во всех трёх режимах — он не отличает рабочую конфигурацию от сломанной. Полный разбор — в отчёте Time-to-first-token не описывает thinking-модель.

Что не проходится нигде

Пословный бюджет на запрос: в обоих режимах, где ответы вообще доходят — без размышления и на бюджете 4096 — заметная доля ответов превышала длину, о которой просил промпт. (На бюджете 1024 провалы формата — это сами пустые ответы.) Эта многословность — свойство модели на этом корпусе, и именно поэтому карточка не получила PASS WITH LIMITS.

Реплицировано на втором юните

Все три однопользовательские ячейки перепрогнаны на втором, коммерчески идентичном GTR9 Pro с бит-в-бит тем же артефактом модели: картина воспроизвелась (мгновенные ответы без размышления, большинство пустых на бюджете 1024, десятки секунд на 4096), и однопользовательские цифры выше выведены по обоим юнитам. Деталь, которую добавила репликация: на втором юните один запрос из 48 исчерпал даже бюджет 4096 токенов — больший бюджет снижает риск пустого ответа, но не устраняет его.

Под конкуренцией (closed loop)

С отключённым размышлением и 4 одновременными потоками медиана первого токена ответа сдвигается до 338мсrepeated; с 8 потоками — до 865мсrepeated — при доле завершения 100.0% запросовrepeated и

100.0% запросовrepeated

соответственно. Это closed-loop замер (каждый виртуальный пользователь ждёт свой ответ, прежде чем спросить снова) — он показывает, что чувствует каждый из N одновременных пользователей, и это не заявление о пропускной способности или SLO.

Операционный конверт по данным

Для роли бытового ассистента на этой конфигурации: отключайте блок размышления — либо закладывайте минимум 4096 токенов бюджета и принимайте ожидание. Не выкатывайте дефолтную комбинацию «размышление включено + 1024 токена»; считайте пустые ответы ошибками в мониторинге.

Что изменит вердикт

Оценка качества ответов в режиме без размышления (здесь не проверялась — вероятно, хуже), конкуренция выше 8 и обновление runtime или артефакта модели — любое из этого триггерит ревалидацию. Сырые пакеты доказательств и харнесс открыты: agmind-bench, методология — на странице доказательств и данных.

← Проверенные конфигурации