Отчёт

Отключать ли thinking? Сколько стоит режим размышлений на локальной LLM — измерено

Режим размышлений на локальной модели превращает первое видимое слово из мгновения в ожидание и умножает цену автоматизации — а на всех задачах с жёстким правильным ответом наши гейты не увидели выигрыша. Измеренный размен и где он не действует.

lab_repeated internal research 20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Короткий измеренный ответ: для повседневного чата и для структурной автоматизации на этой коробке режим thinking не купил ничего, что наши гейты смогли бы обнаружить, а стоил от одного до двух порядков ожидания. Выключить — правильный дефолт для этих ворклоадов. Цифры и честная граница этого совета — ниже.

Каждая рассуждающая локальная модель приезжает с одним и тем же немым вопросом: оставить блок размышлений включённым или подавить? Спор обычно идёт на ощущениях — «так умнее» против «так медленно». За обоими ощущениями есть измеримая субстанция, и только одно пережило наши гейты.

Сколько ждать первого видимого слова?

С выключенным reasoning первый токен ответа ассистента приходит за 210мсunit_replicated — мгновение. С включённым та же модель на той же коробке тратит 20191мсunit_replicated, чтобы сказать первое видимое слово. Не закончить — начать.

Обратите внимание на метрику: время до первого токена ответа. Дашборд, следящий за временем до первого токена чего угодно, показал бы оба режима почти мгновенными, потому что поток размышлений стартует сразу — просто он адресован не пользователю. Этот разрыв измерений — отдельный отчёт.

Во что это обходится автоматизации?

Чат прячет задержку за стримингом; пайплайн — нет. Задача строгого JSON проходит от начала до конца за 844мсrepeated с выключенным reasoning против 14677мсrepeated со стандартным бюджетом размышлений. Для очереди автоматических вызовов этот множитель — разница между инструментом и бутылочным горлышком.

Что купил thinking?

На наших гейтах — ничего обнаружимого. Успех задач строгого JSON — вывод парсится и совпадает с ground truth по каждому ключу — вернулся на 100.0% запросовrepeated с выключенным reasoning и на 100.0% запросовrepeated с включённым. Корпус повседневного ассистента показал ту же картину через гейты формата, языка и повторов. Одинаковое качество, от одного до двух порядков разницы во времени.

Где этот совет заканчивается

Прочитайте скоуп, прежде чем цитировать вердикт. Наши корпуса — это повседневные запросы и детерминированные короткие задачи с закрытыми наборами меток: ворклоады, где ответ проверяем и модель его уже знает. По-настоящему трудные задачи — многошаговая математика, планирование с нуля — ровно то место, где режимы рассуждений отрабатывают своё, и наши ворклоады их не щупают. Честная формулировка узка: если ваша нагрузка похожа на чат и структурную автоматизацию, thinking — налог без измеренной отдачи; если ваша нагрузка — трудные рассуждения, эта страница вам не доказательство.

Есть и отказный режим, о котором стоит знать, прежде чем оставлять thinking включённым с маленьким бюджетом токенов: модель может потратить весь бюджет на размышления и вернуть пустой ответ под HTTP 200. Мы измерили это на замороженном ворклоаде, а затем встретили вживую на собственной коробке. Оставляете reasoning включённым — заложите это в бюджет.

Как его на самом деле выключить

Механика различается по рантаймам и шаблонам: llama.cpp принимает переключатель чат-шаблона для моделей, чьи шаблоны это умеют, а большинство рассуждающих моделей уважают явную no-think-инструкцию или настройку бюджета рассуждений. Проверяйте по работающему серверу, а не по документации: спросите его, какой шаблон и какие настройки он разрешил, затем отправьте один запрос и посмотрите, появился ли блок размышлений. Параллельная матрица для этой модели — на странице сравнения.

У каждой цифры выше есть постоянная страница со скоупом, ограничениями и сырыми прогонами: реестр клеймов.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-20). Отключать ли thinking? Сколько стоит режим размышлений на локальной LLM — измерено. Evidence level: lab_repeated. https://agmind.ai/ru/reports/should-you-disable-thinking-local-llm/
← Отчёты