Короткий измеренный ответ для этой коробки и этих моделей: одно семейство находило то, что в документе было, и признавало то, чего не было, — без исключений. Другое находило почти всё, а когда вопрос не имел ответа в документе, иногда проваливалось не выдумкой, а полным молчанием. Важны оба поведения, и второе невидимо, пока не измеряешь его намеренно.
«А оно не будет галлюцинировать на моих документах?» — первый вопрос, который задают, прежде чем доверить локальной модели настоящие файлы, и отвечают на него почти всегда ощущениями или лидербордами, снятыми в чужих облаках. Наш длинноконтекстный ворклоад задаёт его напрямую, на потребительском железе, с контрольной группой.
Что это за тест на самом деле?
В промпт кладётся документ — от 2k до 32k токенов, английский и русский — с конкретным извлекаемым фактом и материалом-дистрактором, подобранным похожим на него. Дальше два вида вопросов. Вопросы-иголки имеют ответ в документе, и гейт проверяет, что модель вернула ровно этот факт. Контрольные вопросы — суть теста: они спрашивают о том, чего в документе нет, и гейт засчитывает модель, только если она так и говорит. Ответить на контрольный вопрос уверенным значением — тот самый провал, которого все боятся; гейт заодно требует, чтобы любое кодоподобное значение в ответе дословно цитировалось из источника, так что выдуманное не проскочит как почти-попадание. Отказавшие запросы остаются в знаменателе.
Нашли ли модели то, что там было?
Qwen3.6-35B-A3B извлекал иголку на 100.0% запросовrepeated по всей лестнице глубин. gemma-4-26B-A4B подошла близко: 95.8% запросовrepeated. Извлечение из десятков тысяч токенов для этого класса моделей на этой коробке — задача в основном решённая, и именно поэтому интересный результат живёт в контрольной группе.
Признали ли они то, чего там не было?
Qwen3.6 отклонил каждый невозможный вопрос: 100.0% запросовunit_replicated на контроле без ответа. gemma-4 прошла 75.0% запросовrepeated из них — и её провалы оказались не такими, каких мы ждали.
Как выглядели провалы?
Не выдумкой. Когда gemma-4 проваливала контрольный вопрос, доминирующим паттерном был пустой ответ: проход размышлений сжигал бюджет токенов на взвешивание и не выдавал ничего, адресованного пользователю. HTTP 200, ни выдуманного значения, ни ответа вообще. Это существенно другой риск, чем галлюцинация — пайплайн получает пустоту вместо лжи, — и он смыкается с режимом отказа, который мы измеряем отдельно: запрос без ответа. Модель, которая не умеет дёшево сказать «этого здесь нет», может вместо этого дорого не сказать ничего.
Значит ли это, что эти модели никогда не выдумывают?
Нет, и скоуп важен. Контроль синтетический: факты в форме кода в сконструированных документах — дизайн, который делает оценку механической, а выдумку — обнаружимой. Враждебные домены, двусмысленные вопросы, противоречащие друг другу источники — ничего из этого здесь не щупается, и чистый контрольный лист на этом ворклоаде — не общий сертификат иммунитета для какой бы то ни было модели. Измерение устанавливает более узкое и всё равно полезное: на документах такой формы, на этих глубинах, одна готовая конфигурация отклонила каждый невозможный вопрос, а провалы другой были молчанием, а не выдумкой.
Как прогнать эту проверку самому?
Контракт ворклоада, корпуса и оценочные гейты — включая маркеры отказа по границам слов и проверку заземлённости — в открытом харнессе. Наведите его на свой сервер и свои документы; если ваши цифры разойдутся с нашими, мы хотим их видеть.
У каждой цифры выше есть постоянная страница со скоупом, ограничениями и сырыми прогонами: реестр клеймов.