На какой вопрос отвечает карточка
Отзывчив ли однопользовательский стриминговый чат на этой точной конфигурации для повседневных человеческих задач — сообщений, писем, объяснений ребёнку, планов?
Вердикт: PARTIAL. Конфигурация чисто проходит в одном режиме работы, структурно падает в другом, и один гейт качества не проходится полностью ни в одном режиме. Детали — это и есть продукт; вот они.
Что проходит
С отключённым через chat template блоком размышления первый токен ответа приходит с медианой 210мсunit_replicated — ответ начинается вместе с потоком, а доля завершившихся ответом запросов в шести повторных прогонах на двух юнитах — 100.0% запросовunit_replicated, при пройденных гейтах языка и повторов.
Что падает
С включённым размышлением при бюджете 1024 токена 58.3% запросовunit_replicated бытовых запросов вернули HTTP 200 с пустым ответом: проход размышления съел весь бюджет до начала ответа. Приложение, проверяющее коды статуса, записывает их в успехи.
Поднятие бюджета до 4096 токенов убирает пустые ответы, но первый токен ответа тогда приходит с медианой 20191мсunit_replicated — десятки секунд видимого «размышления» перед ответом на запрос вида «напиши соседке сообщение из двух предложений».
При этом конвенциональный time-to-first-token равен 212мсunit_replicated во всех трёх режимах — он не отличает рабочую конфигурацию от сломанной. Полный разбор — в отчёте Time-to-first-token не описывает thinking-модель.
Что не проходится нигде
Пословный бюджет на запрос: в обоих режимах, где ответы вообще доходят — без размышления и на бюджете 4096 — заметная доля ответов превышала длину, о которой просил промпт. (На бюджете 1024 провалы формата — это сами пустые ответы.) Эта многословность — свойство модели на этом корпусе, и именно поэтому карточка не получила PASS WITH LIMITS.
Реплицировано на втором юните
Все три однопользовательские ячейки перепрогнаны на втором, коммерчески идентичном GTR9 Pro с бит-в-бит тем же артефактом модели: картина воспроизвелась (мгновенные ответы без размышления, большинство пустых на бюджете 1024, десятки секунд на 4096), и однопользовательские цифры выше выведены по обоим юнитам. Деталь, которую добавила репликация: на втором юните один запрос из 48 исчерпал даже бюджет 4096 токенов — больший бюджет снижает риск пустого ответа, но не устраняет его.
Под конкуренцией (closed loop)
С отключённым размышлением и 4 одновременными потоками медиана первого токена ответа сдвигается до 338мсrepeated; с 8 потоками — до 865мсrepeated — при доле завершения 100.0% запросовrepeated и
100.0% запросовrepeatedсоответственно. Это closed-loop замер (каждый виртуальный пользователь ждёт свой ответ, прежде чем спросить снова) — он показывает, что чувствует каждый из N одновременных пользователей, и это не заявление о пропускной способности или SLO.
Операционный конверт по данным
Для роли бытового ассистента на этой конфигурации: отключайте блок размышления — либо закладывайте минимум 4096 токенов бюджета и принимайте ожидание. Не выкатывайте дефолтную комбинацию «размышление включено + 1024 токена»; считайте пустые ответы ошибками в мониторинге.
Что изменит вердикт
Оценка качества ответов в режиме без размышления (здесь не проверялась — вероятно, хуже), конкуренция выше 8 и обновление runtime или артефакта модели — любое из этого триггерит ревалидацию. Сырые пакеты доказательств и харнесс открыты: agmind-bench, методология — на странице доказательств и данных.