Workload

long-context-v1

released

На какой вопрос отвечает

Какова глубина полезного контекста на системе — а не настраиваемого?

Что измеряется

Поиск иголки по номинальной лестнице контекста 2k/8k/16k/32k — 12 элементов, EN (Диккенс) + RU (Достоевский); измеренные токены промпта ниже номинала (EN в пределах ~6%, RU на уровне ~65%) и опубликованы рядом с корпусом — плюс unanswerable-контроли с присутствующим дистрактором; гейты формата, языка, повторов, иголки и контроля; качество, TTFT и e2e-время на каждой глубине.

Какие заявления этот workload поддержать не может

«Держит 128K контекста» на основании одного факта аллокации памяти; заявления о понимании — эта ревизия варьирует длину при фиксированной позиции иголки ~50%, развёртка по позициям и суммаризация — будущие ревизии.

Замороженная идентичность

Каждая released-ревизия workload замораживает хэши элементов, модель нагрузки и quality-гейты. Результаты ссылаются на точную ревизию; изменение любого поля идентичности создаёт новую ревизию. Факты ниже читаются из файла каталога, а не набраны на странице.

Ревизия
2026-08-03
Модель нагрузки
single_stream
Quality-гейты
format_gate, language_gate, repetition_gate, needle_gate, control_gate
Контракт метрик
quality_at_depth, ttft_ms_at_depth, e2e_ms_at_depth
Хэш корпуса
2184f558eb79…
← Библиотека workloads