# Выдумывают ли локальные LLM ответы, которых нет в документе? Мы измерили

> Галлюцинирует ли локальная модель на ваших документах — спрашивают все, измеряют единицы. В наш ворклоад встроен контроль: вопросы, на которые документ ответить не может, оцениваются по тому, признаёт ли это модель. Два семейства моделей — два способа не знать.

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/do-local-llms-invent-answers/

Короткий измеренный ответ для этой коробки и этих моделей: одно семейство
находило то, что в документе было, и признавало то, чего не было, — без
исключений. Другое находило почти всё, а когда вопрос не имел ответа в
документе, иногда проваливалось не выдумкой, а полным молчанием. Важны оба
поведения, и второе невидимо, пока не измеряешь его намеренно.

«А оно не будет галлюцинировать на моих документах?» — первый вопрос,
который задают, прежде чем доверить локальной модели настоящие файлы, и
отвечают на него почти всегда ощущениями или лидербордами, снятыми в чужих
облаках. Наш длинноконтекстный ворклоад задаёт его напрямую, на
потребительском железе, с контрольной группой.

## Что это за тест на самом деле?

В промпт кладётся документ — от 2k до 32k токенов, английский и русский —
с конкретным извлекаемым фактом и материалом-дистрактором, подобранным
похожим на него. Дальше два вида вопросов. Вопросы-иголки имеют ответ в
документе, и гейт проверяет, что модель вернула ровно этот факт.
Контрольные вопросы — суть теста: они спрашивают о том, чего в документе
нет, и гейт засчитывает модель, только если она так и говорит. Ответить на
контрольный вопрос уверенным значением — тот самый провал, которого все
боятся; гейт заодно требует, чтобы любое кодоподобное значение в ответе
дословно цитировалось из источника, так что выдуманное не проскочит как
почти-попадание. Отказавшие запросы остаются в знаменателе.

## Нашли ли модели то, что там было?

Qwen3.6-35B-A3B извлекал иголку на
**100.0 % of requests** ([strix.qwen36.longctx.c1.needle-success](https://agmind.ai/claims/strix.qwen36.longctx.c1.needle-success/)) по всей
лестнице глубин. gemma-4-26B-A4B подошла близко:
**95.8 % of requests** ([strix.gemma4.longctx.c1.needle-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.needle-success/)). Извлечение из
десятков тысяч токенов для этого класса моделей на этой коробке — задача
в основном решённая, и именно поэтому интересный результат живёт в
контрольной группе.

## Признали ли они то, чего там не было?

Qwen3.6 отклонил каждый невозможный вопрос:
**100.0 % of requests** ([strix.qwen36.longctx.c1.control-success](https://agmind.ai/claims/strix.qwen36.longctx.c1.control-success/)) на контроле
без ответа. gemma-4 прошла
**75.0 % of requests** ([strix.gemma4.longctx.c1.control-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.control-success/)) из них — и её
провалы оказались не такими, каких мы ждали.

## Как выглядели провалы?

Не выдумкой. Когда gemma-4 проваливала контрольный вопрос, доминирующим
паттерном был пустой ответ: проход размышлений сжигал бюджет токенов на
взвешивание и не выдавал ничего, адресованного пользователю. HTTP 200, ни
выдуманного значения, ни ответа вообще. Это существенно другой риск, чем
галлюцинация — пайплайн получает пустоту вместо лжи, — и он смыкается с
режимом отказа, который мы измеряем отдельно:
[запрос без ответа](https://agmind.ai/ru/reports/answerless-http-200/). Модель, которая не
умеет дёшево сказать «этого здесь нет», может вместо этого дорого не
сказать ничего.

## Значит ли это, что эти модели никогда не выдумывают?

Нет, и скоуп важен. Контроль синтетический: факты в форме кода в
сконструированных документах — дизайн, который делает оценку механической,
а выдумку — обнаружимой. Враждебные домены, двусмысленные вопросы,
противоречащие друг другу источники — ничего из этого здесь не щупается, и
чистый контрольный лист на этом ворклоаде — не общий сертификат иммунитета
для какой бы то ни было модели. Измерение устанавливает более узкое и всё
равно полезное: на документах такой формы, на этих глубинах, одна готовая
конфигурация отклонила каждый невозможный вопрос, а провалы другой были
молчанием, а не выдумкой.

## Как прогнать эту проверку самому?

Контракт ворклоада, корпуса и оценочные гейты — включая маркеры отказа по
границам слов и проверку заземлённости — в
[открытом харнессе](https://github.com/botAGI/agmind-bench). Наведите его
на свой сервер и свои документы; если ваши цифры разойдутся с нашими,
[мы хотим их видеть](https://github.com/botAGI/agmind-lab/issues/new).

У каждой цифры выше есть постоянная страница со скоупом, ограничениями и
сырыми прогонами: [реестр клеймов](https://agmind.ai/ru/claims/).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
