Workload
long-context-v1
На какой вопрос отвечает
Какова глубина полезного контекста на системе — а не настраиваемого?
Что измеряется
Поиск иголки по номинальной лестнице контекста 2k/8k/16k/32k — 12 элементов, EN (Диккенс) + RU (Достоевский); измеренные токены промпта ниже номинала (EN в пределах ~6%, RU на уровне ~65%) и опубликованы рядом с корпусом — плюс unanswerable-контроли с присутствующим дистрактором; гейты формата, языка, повторов, иголки и контроля; качество, TTFT и e2e-время на каждой глубине.
Какие заявления этот workload поддержать не может
«Держит 128K контекста» на основании одного факта аллокации памяти; заявления о понимании — эта ревизия варьирует длину при фиксированной позиции иголки ~50%, развёртка по позициям и суммаризация — будущие ревизии.
Замороженная идентичность
Каждая released-ревизия workload замораживает хэши элементов, модель нагрузки и quality-гейты. Результаты ссылаются на точную ревизию; изменение любого поля идентичности создаёт новую ревизию. Факты ниже читаются из файла каталога, а не набраны на странице.
- Ревизия
- 2026-08-03
- Модель нагрузки
- single_stream
- Quality-гейты
- format_gate, language_gate, repetition_gate, needle_gate, control_gate
- Контракт метрик
- quality_at_depth, ttft_ms_at_depth, e2e_ms_at_depth
- Хэш корпуса
- 2184f558eb79…