Отчёт

Выдумывают ли локальные LLM ответы, которых нет в документе? Мы измерили

Галлюцинирует ли локальная модель на ваших документах — спрашивают все, измеряют единицы. В наш ворклоад встроен контроль: вопросы, на которые документ ответить не может, оцениваются по тому, признаёт ли это модель. Два семейства моделей — два способа не знать.

lab_repeated internal research 20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Короткий измеренный ответ для этой коробки и этих моделей: одно семейство находило то, что в документе было, и признавало то, чего не было, — без исключений. Другое находило почти всё, а когда вопрос не имел ответа в документе, иногда проваливалось не выдумкой, а полным молчанием. Важны оба поведения, и второе невидимо, пока не измеряешь его намеренно.

«А оно не будет галлюцинировать на моих документах?» — первый вопрос, который задают, прежде чем доверить локальной модели настоящие файлы, и отвечают на него почти всегда ощущениями или лидербордами, снятыми в чужих облаках. Наш длинноконтекстный ворклоад задаёт его напрямую, на потребительском железе, с контрольной группой.

Что это за тест на самом деле?

В промпт кладётся документ — от 2k до 32k токенов, английский и русский — с конкретным извлекаемым фактом и материалом-дистрактором, подобранным похожим на него. Дальше два вида вопросов. Вопросы-иголки имеют ответ в документе, и гейт проверяет, что модель вернула ровно этот факт. Контрольные вопросы — суть теста: они спрашивают о том, чего в документе нет, и гейт засчитывает модель, только если она так и говорит. Ответить на контрольный вопрос уверенным значением — тот самый провал, которого все боятся; гейт заодно требует, чтобы любое кодоподобное значение в ответе дословно цитировалось из источника, так что выдуманное не проскочит как почти-попадание. Отказавшие запросы остаются в знаменателе.

Нашли ли модели то, что там было?

Qwen3.6-35B-A3B извлекал иголку на 100.0% запросовrepeated по всей лестнице глубин. gemma-4-26B-A4B подошла близко: 95.8% запросовrepeated. Извлечение из десятков тысяч токенов для этого класса моделей на этой коробке — задача в основном решённая, и именно поэтому интересный результат живёт в контрольной группе.

Признали ли они то, чего там не было?

Qwen3.6 отклонил каждый невозможный вопрос: 100.0% запросовunit_replicated на контроле без ответа. gemma-4 прошла 75.0% запросовrepeated из них — и её провалы оказались не такими, каких мы ждали.

Как выглядели провалы?

Не выдумкой. Когда gemma-4 проваливала контрольный вопрос, доминирующим паттерном был пустой ответ: проход размышлений сжигал бюджет токенов на взвешивание и не выдавал ничего, адресованного пользователю. HTTP 200, ни выдуманного значения, ни ответа вообще. Это существенно другой риск, чем галлюцинация — пайплайн получает пустоту вместо лжи, — и он смыкается с режимом отказа, который мы измеряем отдельно: запрос без ответа. Модель, которая не умеет дёшево сказать «этого здесь нет», может вместо этого дорого не сказать ничего.

Значит ли это, что эти модели никогда не выдумывают?

Нет, и скоуп важен. Контроль синтетический: факты в форме кода в сконструированных документах — дизайн, который делает оценку механической, а выдумку — обнаружимой. Враждебные домены, двусмысленные вопросы, противоречащие друг другу источники — ничего из этого здесь не щупается, и чистый контрольный лист на этом ворклоаде — не общий сертификат иммунитета для какой бы то ни было модели. Измерение устанавливает более узкое и всё равно полезное: на документах такой формы, на этих глубинах, одна готовая конфигурация отклонила каждый невозможный вопрос, а провалы другой были молчанием, а не выдумкой.

Как прогнать эту проверку самому?

Контракт ворклоада, корпуса и оценочные гейты — включая маркеры отказа по границам слов и проверку заземлённости — в открытом харнессе. Наведите его на свой сервер и свои документы; если ваши цифры разойдутся с нашими, мы хотим их видеть.

У каждой цифры выше есть постоянная страница со скоупом, ограничениями и сырыми прогонами: реестр клеймов.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-20). Выдумывают ли локальные LLM ответы, которых нет в документе? Мы измерили. Evidence level: lab_repeated. https://agmind.ai/ru/reports/do-local-llms-invent-answers/
← Отчёты