# Отключать ли thinking? Сколько стоит режим размышлений на локальной LLM — измерено

> Режим размышлений на локальной модели превращает первое видимое слово из мгновения в ожидание и умножает цену автоматизации — а на всех задачах с жёстким правильным ответом наши гейты не увидели выигрыша. Измеренный размен и где он не действует.

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/should-you-disable-thinking-local-llm/

Короткий измеренный ответ: для повседневного чата и для структурной
автоматизации на этой коробке режим thinking не купил ничего, что наши
гейты смогли бы обнаружить, а стоил от одного до двух порядков ожидания.
Выключить — правильный дефолт для этих ворклоадов. Цифры и честная граница
этого совета — ниже.

Каждая рассуждающая локальная модель приезжает с одним и тем же немым
вопросом: оставить блок размышлений включённым или подавить? Спор обычно
идёт на ощущениях — «так умнее» против «так медленно». За обоими
ощущениями есть измеримая субстанция, и только одно пережило наши гейты.

## Сколько ждать первого видимого слова?

С выключенным reasoning первый токен ответа ассистента приходит за
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)) —
мгновение. С включённым та же модель на той же коробке тратит
**20191 ms** ([strix.qwen36.interactive2.c1.ttfa-thinking](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-thinking/)), чтобы
сказать первое видимое слово. Не закончить — начать.

Обратите внимание на метрику: время до первого токена *ответа*. Дашборд,
следящий за временем до первого токена чего угодно, показал бы оба режима
почти мгновенными, потому что поток размышлений стартует сразу — просто он
адресован не пользователю. Этот разрыв измерений —
[отдельный отчёт](https://agmind.ai/ru/reports/ttft-thinking-model-strix-halo/).

## Во что это обходится автоматизации?

Чат прячет задержку за стримингом; пайплайн — нет. Задача строгого JSON
проходит от начала до конца за
**844 ms** ([strix.qwen36.structured.c1.e2e-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.e2e-nothink/)) с выключенным
reasoning против **14677 ms** ([strix.qwen36.structured.c1.e2e-think4k](https://agmind.ai/claims/strix.qwen36.structured.c1.e2e-think4k/))
со стандартным бюджетом размышлений. Для очереди автоматических вызовов
этот множитель — разница между инструментом и бутылочным горлышком.

## Что купил thinking?

На наших гейтах — ничего обнаружимого. Успех задач строгого JSON — вывод
парсится и совпадает с ground truth по каждому ключу — вернулся на
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/)) с
выключенным reasoning и на
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-think4k](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-think4k/)) с
включённым. Корпус повседневного ассистента показал ту же картину через
гейты формата, языка и повторов. Одинаковое качество, от одного до двух
порядков разницы во времени.

## Где этот совет заканчивается

Прочитайте скоуп, прежде чем цитировать вердикт. Наши корпуса — это
повседневные запросы и детерминированные короткие задачи с закрытыми
наборами меток: ворклоады, где ответ проверяем и модель его уже знает.
По-настоящему трудные задачи — многошаговая математика, планирование с
нуля — ровно то место, где режимы рассуждений отрабатывают своё, и наши
ворклоады их не щупают. Честная формулировка узка: если ваша нагрузка
похожа на чат и структурную автоматизацию, thinking — налог без измеренной
отдачи; если ваша нагрузка — трудные рассуждения, эта страница вам не
доказательство.

Есть и отказный режим, о котором стоит знать, прежде чем оставлять
thinking включённым с маленьким бюджетом токенов: модель может потратить
весь бюджет на размышления и вернуть пустой ответ под HTTP 200. Мы
измерили это на замороженном ворклоаде, а затем
[встретили вживую на собственной коробке](https://agmind.ai/ru/essays/dashboard-lies-both-directions/).
Оставляете reasoning включённым — заложите это в бюджет.

## Как его на самом деле выключить

Механика различается по рантаймам и шаблонам: llama.cpp принимает
переключатель чат-шаблона для моделей, чьи шаблоны это умеют, а
большинство рассуждающих моделей уважают явную no-think-инструкцию или
настройку бюджета рассуждений. Проверяйте по работающему серверу, а не по
документации: спросите его, какой шаблон и какие настройки он разрешил,
затем отправьте один запрос и посмотрите, появился ли блок размышлений.
Параллельная матрица для этой модели — на
[странице сравнения](https://agmind.ai/ru/compare/thinking-vs-no-thinking-qwen36/).

У каждой цифры выше есть постоянная страница со скоупом, ограничениями и
сырыми прогонами: [реестр клеймов](https://agmind.ai/ru/claims/).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
