Короткий измеренный ответ: для повседневного чата и для структурной автоматизации на этой коробке режим thinking не купил ничего, что наши гейты смогли бы обнаружить, а стоил от одного до двух порядков ожидания. Выключить — правильный дефолт для этих ворклоадов. Цифры и честная граница этого совета — ниже.
Каждая рассуждающая локальная модель приезжает с одним и тем же немым вопросом: оставить блок размышлений включённым или подавить? Спор обычно идёт на ощущениях — «так умнее» против «так медленно». За обоими ощущениями есть измеримая субстанция, и только одно пережило наши гейты.
Сколько ждать первого видимого слова?
С выключенным reasoning первый токен ответа ассистента приходит за 210мсunit_replicated — мгновение. С включённым та же модель на той же коробке тратит 20191мсunit_replicated, чтобы сказать первое видимое слово. Не закончить — начать.
Обратите внимание на метрику: время до первого токена ответа. Дашборд, следящий за временем до первого токена чего угодно, показал бы оба режима почти мгновенными, потому что поток размышлений стартует сразу — просто он адресован не пользователю. Этот разрыв измерений — отдельный отчёт.
Во что это обходится автоматизации?
Чат прячет задержку за стримингом; пайплайн — нет. Задача строгого JSON проходит от начала до конца за 844мсrepeated с выключенным reasoning против 14677мсrepeated со стандартным бюджетом размышлений. Для очереди автоматических вызовов этот множитель — разница между инструментом и бутылочным горлышком.
Что купил thinking?
На наших гейтах — ничего обнаружимого. Успех задач строгого JSON — вывод парсится и совпадает с ground truth по каждому ключу — вернулся на 100.0% запросовrepeated с выключенным reasoning и на 100.0% запросовrepeated с включённым. Корпус повседневного ассистента показал ту же картину через гейты формата, языка и повторов. Одинаковое качество, от одного до двух порядков разницы во времени.
Где этот совет заканчивается
Прочитайте скоуп, прежде чем цитировать вердикт. Наши корпуса — это повседневные запросы и детерминированные короткие задачи с закрытыми наборами меток: ворклоады, где ответ проверяем и модель его уже знает. По-настоящему трудные задачи — многошаговая математика, планирование с нуля — ровно то место, где режимы рассуждений отрабатывают своё, и наши ворклоады их не щупают. Честная формулировка узка: если ваша нагрузка похожа на чат и структурную автоматизацию, thinking — налог без измеренной отдачи; если ваша нагрузка — трудные рассуждения, эта страница вам не доказательство.
Есть и отказный режим, о котором стоит знать, прежде чем оставлять thinking включённым с маленьким бюджетом токенов: модель может потратить весь бюджет на размышления и вернуть пустой ответ под HTTP 200. Мы измерили это на замороженном ворклоаде, а затем встретили вживую на собственной коробке. Оставляете reasoning включённым — заложите это в бюджет.
Как его на самом деле выключить
Механика различается по рантаймам и шаблонам: llama.cpp принимает переключатель чат-шаблона для моделей, чьи шаблоны это умеют, а большинство рассуждающих моделей уважают явную no-think-инструкцию или настройку бюджета рассуждений. Проверяйте по работающему серверу, а не по документации: спросите его, какой шаблон и какие настройки он разрешил, затем отправьте один запрос и посмотрите, появился ли блок размышлений. Параллельная матрица для этой модели — на странице сравнения.
У каждой цифры выше есть постоянная страница со скоупом, ограничениями и сырыми прогонами: реестр клеймов.