# HTTP 200 и пустой ответ: режим отказа, которого не видит ваш мониторинг

> Reasoning-модель может потратить весь токен-бюджет на размышления и вернуть успешный ответ с нулём видимого пользователю текста. Мы измерили, как часто это происходит на двух семействах моделей — и почему TTFT-дашборды при этом выглядят идеально.

- Published: 2026-08-14
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/answerless-http-200/

В локальных reasoning-моделях есть режим отказа, который не покажет ни один
дашборд доступности. Сервер принимает запрос, стримит токены, возвращает
HTTP 200 — а пользователь не получает ничего, потому что каждый
произведённый токен был рассуждением, и бюджет закончился до первого символа
собственно ответа. Запрос, закончившийся так, мы называем
[answerless-запросом](https://agmind.ai/ru/glossary/#answerless-request) и меряем как
полноценный исход: пустой ответ — это отказ, и он остаётся в знаменателе.

## Как часто это происходит на самом деле

На Qwen3.6-35B-A3B с включённым reasoning и бюджетом 1024 токена доля
повседневных запросов, вернувшихся answerless, составила
**58.3 % of requests** ([strix.qwen36.interactive2.c1.answerless-1k](https://agmind.ai/claims/strix.qwen36.interactive2.c1.answerless-1k/)) на корпусе
человеческих задач — сообщения, письма, объяснения, планы. На старом
самореферентном бенчмарк-корпусе та же ячейка дала
**75.0 % of requests** ([strix.qwen36.interactive.c1.answerless-1k](https://agmind.ai/claims/strix.qwen36.interactive.c1.answerless-1k/)). Больше
половины обычных запросов — молча без ответа, при рапорте об успехе на
каждом.

Второе семейство моделей воспроизводит механизм. Gemma-4-26B в дефолтном
режиме вернула answerless
**8.3 % of requests** ([strix.gemma4.interactive2.c1.answerless-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.answerless-default/))
запросов — рейт намного ниже, но не ноль, на модели, чей chat-template
даже не выставляет переключатель reasoning наружу. Это не причуда одной
модели; это то, что происходит всегда, когда размышляющий проход и
токен-бюджет делят одно окно генерации.

## Почему дашборд говорит, что всё хорошо

Каждая привычная метрика выглядит здоровой, пока это происходит:

- **HTTP-статус** — 200: запрос завершился.
- **TTFT** — отличный: первый токен *любого* вывода у Gemma-4 приходил с
  медианой **282 ms** ([strix.gemma4.interactive2.c1.ttft-any-token](https://agmind.ai/claims/strix.gemma4.interactive2.c1.ttft-any-token/)).
  Но это токен рассуждений, не ответа — первый токен собственно ответа
  приходил через
  **10768 ms** ([strix.gemma4.interactive2.c1.ttfa-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.ttfa-default/)), а на
  answerless-доле не приходил вовсе.
- **Сгенерированные токены** — много: модель усердно работала. Просто весь
  бюджет ушёл на текст, который пользователь не просил читать.

Ловит это единственная метрика, которую почти никто не собирает: **токены
ответа** — токены после закрытия reasoning-блока. Поэтому наш харнесс
считает [TTFA](https://agmind.ai/ru/glossary/#ttfa) отдельно от TTFT и трактует пустой ответ
как отказавший запрос, даже когда транспорт отработал успешно.

## Что с этим делать

- **Закладывайте бюджет на рассуждения, а не только на ответ.** Окно в 1024
  токена, вмещающее любой ответ нашего корпуса, почти не вмещает пару
  «рассуждения + ответ». Кривая отказов — это кривая бюджетного голодания,
  а не дефект модели.
- **Или выключайте reasoning для повседневного трафика.** На той же машине
  отключение блока рассуждений срезало ожидание первого ответа с десятков
  секунд до
  **210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)) при
  неизменном успехе задач на этих ворклоадах — см.
  [сравнение цены reasoning](https://agmind.ai/ru/compare/thinking-vs-no-thinking-qwen36/).
- **Мониторьте токены ответа.** Если ваш стек не отличает токены рассуждений
  от токенов ответа, этот отказ для вас невидим. Поля `usage`, которые их
  сливают, его прячут.

## Ограничения

- Два семейства моделей, одна машина (Strix Halo, llama.cpp Vulkan, запинен
  digest'ом), замороженные корпуса, один поток. Рейты — свойства ячейки
  модель × бюджет × корпус, а не универсальные константы.
- Утверждение о механизме — рассуждения съедают общий бюджет до первого
  токена ответа — проверяется поштучно по публичным
  [записям качества](https://github.com/botAGI/agmind-lab): у каждого
  answerless-запроса ненулевые символы рассуждений и ноль символов ответа.
- Вендорские API мы не меряли; у них другая работа с бюджетами.

У каждой цифры выше — постоянная страница со скоупом, ограничениями и
запечатанными доказательствами: [реестр клеймов](https://agmind.ai/ru/claims/). Термин
определён в [глоссарии](https://agmind.ai/ru/glossary/#answerless-request).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
