Контролируемое сравнение

Thinking против no-thinking: сколько стоит reasoning в чате

Оставлять ли reasoning-блок включённым для повседневных ассистентских задач на локальном Qwen3.6-35B-A3B?

Что было зафиксировано

Один юнит, бэкенд, артефакт и корпуса; меняется только переключатель reasoning (chat-template, бюджет 4096 токенов во включённом состоянии).

Метрика Reasoning выключен Reasoning включён (4096)
Время до первого токена ОТВЕТА, медиана (чат) 210мсmedian over valid requests · lab_unit_replicated · доказательства 20191мсmedian over valid requests · lab_unit_replicated · доказательства
Полное время до готового JSON-ответа, медиана 844мсmedian over valid requests · lab_repeated · доказательства 14677мсmedian over valid requests · lab_repeated · доказательства
Успех strict-JSON задач 100.0% запросовshare of all issued requests · lab_repeated · доказательства 100.0% запросовshare of all issued requests · lab_repeated · доказательства

Как это читать

Для этих повседневных задач reasoning умножил ожидание на два порядка и не улучшил ничего, что меряют гейты: успех задач идентичен с ним и без него. Видимая пользователю разница — мгновенный ассистент против двадцатисекундной паузы до первого токена ответа.

Ограничения

Только корпуса повседневных задач и strict-JSON — reasoning может окупаться на действительно сложных задачах (математика, многошаговое планирование), которых в этих ворклоадах нет. Сторона издержек — общая; сторона пользы — ограниченная.

Отвечаете на этот вопрос где-то? Вставьте таблицу

Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.

Связанные доказательства

← Все сравнения