# Thinking против no-thinking: сколько стоит reasoning в чате

Оставлять ли reasoning-блок включённым для повседневных ассистентских задач на локальном Qwen3.6-35B-A3B?

Для этих повседневных задач reasoning умножил ожидание на два порядка и не улучшил ничего, что меряют гейты: успех задач идентичен с ним и без него. Видимая пользователю разница — мгновенный ассистент против двадцатисекундной паузы до первого токена ответа.

**Что было зафиксировано.** Один юнит, бэкенд, артефакт и корпуса; меняется только переключатель reasoning (chat-template, бюджет 4096 токенов во включённом состоянии).

| Метрика | Reasoning выключен | Reasoning включён (4096) |
| --- | --- | --- |
| Время до первого токена ОТВЕТА, медиана (чат) | 210 ms ([lab_unit_replicated](https://agmind.ai/ru/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)) | 20191 ms ([lab_unit_replicated](https://agmind.ai/ru/claims/strix.qwen36.interactive2.c1.ttfa-thinking/)) |
| Полное время до готового JSON-ответа, медиана | 844 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.structured.c1.e2e-nothink/)) | 14677 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.structured.c1.e2e-think4k/)) |
| Успех strict-JSON задач | 100.0 % of requests ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.structured.c1.task-success-nothink/)) | 100.0 % of requests ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.structured.c1.task-success-think4k/)) |

## Ограничения

Только корпуса повседневных задач и strict-JSON — reasoning может окупаться на действительно сложных задачах (математика, многошаговое планирование), которых в этих ворклоадах нет. Сторона издержек — общая; сторона пользы — ограниченная.

## Связанные доказательства

- https://agmind.ai/ru/reports/ttft-thinking-model-strix-halo/
- https://agmind.ai/ru/workloads/structured-agent-v1/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/ru/compare/thinking-vs-no-thinking-qwen36/
