Контролируемое сравнение

Gemma 4 против Qwen 3.6: кто возвращает пустой ответ при тесном бюджете токенов?

При одинаковых повседневных запросах и одинаковом бюджете в 1024 токена — какая модель тратит бюджет на размышления и возвращает пустоту?

При одном и том же тесном бюджете модель, которая дольше размышляет, гораздо чаще исчерпывает место, не сказав ничего. Оба сигнала приходят как HTTP 200 — клиент, читающий только код статуса, в обоих случаях видит успех. Лекарство на стороне Qwen — выключить reasoning: на этом корпусе это устраняет сбой полностью.

Что было зафиксировано

Один юнит, бэкенд, корпус и бюджет 1024 токена. Режим — штатное reasoning-поведение каждой модели: gemma-4 в режиме по умолчанию, Qwen3.6 с включённым reasoning. Это сравнение дефолтов под давлением, а не идентичных настроек.

Метрика gemma-4-26B-A4B (режим по умолчанию) Qwen3.6-35B-A3B (reasoning включён)
Пустые ответы под HTTP 200 (answerless), доля запросов 8.3% запросовshare of all issued requests · lab_repeated · доказательства 58.3% запросовshare of all issued requests · lab_unit_replicated · доказательства
Время до первого токена чего угодно, медиана 282мсmedian over answered requests · lab_repeated · доказательства 212мсmedian over all valid requests of three cells · lab_unit_replicated · доказательства
Время до первого токена ОТВЕТА, медиана 10768мсmedian over answered requests · lab_repeated · доказательства 20191мсmedian over valid requests · lab_unit_replicated · доказательства

Ограничения

Один бюджет, один корпус, дефолты против дефолтов: gemma-4 с подавленным reasoning не тестировалась, а больший бюджет меняет обе цифры. Здесь измерено, как отказывают штатные конфигурации, а не какая модель умнее.

Отвечаете на этот вопрос где-то? Вставьте таблицу

Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.

Связанные доказательства

← Все сравнения