Контролируемое сравнение
Thinking против no-thinking: сколько стоит reasoning в чате
Оставлять ли reasoning-блок включённым для повседневных ассистентских задач на локальном Qwen3.6-35B-A3B?
Что было зафиксировано
Один юнит, бэкенд, артефакт и корпуса; меняется только переключатель reasoning (chat-template, бюджет 4096 токенов во включённом состоянии).
| Метрика | Reasoning выключен | Reasoning включён (4096) |
|---|---|---|
| Время до первого токена ОТВЕТА, медиана (чат) | 210мсmedian over valid requests · lab_unit_replicated · доказательства | 20191мсmedian over valid requests · lab_unit_replicated · доказательства |
| Полное время до готового JSON-ответа, медиана | 844мсmedian over valid requests · lab_repeated · доказательства | 14677мсmedian over valid requests · lab_repeated · доказательства |
| Успех strict-JSON задач | 100.0% запросовshare of all issued requests · lab_repeated · доказательства | 100.0% запросовshare of all issued requests · lab_repeated · доказательства |
Как это читать
Для этих повседневных задач reasoning умножил ожидание на два порядка и не улучшил ничего, что меряют гейты: успех задач идентичен с ним и без него. Видимая пользователю разница — мгновенный ассистент против двадцатисекундной паузы до первого токена ответа.
Ограничения
Только корпуса повседневных задач и strict-JSON — reasoning может окупаться на действительно сложных задачах (математика, многошаговое планирование), которых в этих ворклоадах нет. Сторона издержек — общая; сторона пользы — ограниченная.
Отвечаете на этот вопрос где-то? Вставьте таблицу
Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.