На какой вопрос отвечает карточка
Вы вставляете в чат длинный документ и спрашиваете по нему. Находит ли система ответ — и признаётся ли, когда ответа в документе нет — на этой точной конфигурации, и сколько стоит ожидание?
Вердикт: PASS WITH LIMITS. Качество держится на всех измеренных глубинах; практическое ограничение — задержка, и она измерена ниже.
Что мерили
Public-domain проза (Диккенс на английском, Достоевский на русском), нарезанная в лестницу из четырёх ступеней, номинально 2k/8k/16k/32k токенов. Эти подписи — цели, а не измерения: корпус резался по оценке «символов на токен», которая держится на английском (измерено 1.8k–30.0k), но завышает русский примерно на треть (измерено 1.4k–21.1k). Поштучные измеренные значения лежат рядом с корпусом; цифры глубины ниже — только английские и потому не затронуты. В каждый документ вшит один синтетический факт — уникальный код ворот — в середине текста. Поисковые вопросы спрашивают этот код; контрольные спрашивают код, которого в документе нет, при том что похожий факт-дистрактор есть — честный ответ «не указано», выдуманный код проваливает гейт.
Результаты
Поиск иголки: 100.0% запросовrepeated по всей лестнице, оба языка, все повторы. Контроли: 100.0% запросовunit_replicated — модель ни разу не выдумала отсутствующий код, дистрактор не помог.
Цена — ожидание. С документом на 2k токенов первый токен приходит с медианой 1907мсrepeated; с документом на 32k токенов — 33965мсrepeated — рост примерно линейный по длине документа. Вставленный длинный отчёт превращает мгновенного ассистента в полуминутную паузу до первого символа, и на экране эта пауза неотличима от зависания.
Лимиты в «pass with limits»
- Поиск, а не понимание. Синтетическая иголка на фиксированной глубине ~50% — самый честный простой зонд; суммаризация, multi-hop и развёртка по позициям — будущие ревизии.
- Измерено только до 30k токенов (английская ступень 32k). Дальше заявлений нет — большее настраиваемое окно не доказывает большее полезное.
- Один юнит, один поток, размышление отключено, одна сборка runtime, один артефакт; кэш промптов выключен — каждый запрос платит полный префилл.
Триггеры ревалидации
Смена образа runtime (скорость префилла чувствительна к runtime), артефакта модели, ревизии ворклоада, драйвера/ядра. Харнесс и корпус открыты: agmind-bench.