Метод
Библиотека workloads
Фиксированные версионируемые нагрузки с замороженными корпусами, хэшами и acceptance-проверками. Результат квалификации имеет смысл только относительно конкретной ревизии workload — материальное изменение создаёт новую ревизию, а не тихий апдейт.
Released-workloads имеют замороженные корпуса с пиненными хэшами и измеренные прогоны — на них стоят опубликованные клеймы. Черновые определены по идентичности, но корпуса не заморожены — для публичных headline-заявлений они не используются.
- interactive-assistant-v1 released
Отзывчив ли одиночный стриминговый чат на этой системе?
Клиентский TTFT, межтокенная задержка и e2e-время на замороженном корпусе из 16 элементов (EN+RU, три диапазона длины); гейты формата, языка и повторов с поэлементными ожиданиями.
- interactive-assistant-v2 released
Отзывчив ли одиночный стриминговый чат на этой системе в повседневных человеческих задачах?
Тот же контракт, что у v1 — клиентский TTFT, межтокенная задержка, e2e-время; гейты формата, языка и повторов — но на корпусе человеческих задач: повседневные запросы (сообщения, письма, объяснения, планы) вместо самореферентных бенчмарк-вопросов. 16 элементов, EN+RU, три диапазона длины.
- team-serving-v1 Черновик
Какой поток запросов система держит в рамках заявленного SLO?
Планируемый контракт (идентичность ещё не заморожена): развёртка по concurrency (closed-loop) плюс open-loop по замороженному трейсу; goodput vs throughput; отказы остаются в знаменателе; результат — operating envelope.
- long-context-v1 released
Какова глубина полезного контекста на системе — а не настраиваемого?
Поиск иголки по номинальной лестнице контекста 2k/8k/16k/32k — 12 элементов, EN (Диккенс) + RU (Достоевский); измеренные токены промпта ниже номинала (EN в пределах ~6%, RU на уровне ~65%) и опубликованы рядом с корпусом — плюс unanswerable-контроли с присутствующим дистрактором; гейты формата, языка, повторов, иголки и контроля; качество, TTFT и e2e-время на каждой глубине.
- structured-agent-v1 released
Надёжен ли строгий JSON-вывод в повседневных задачах автоматизации на этой системе?
16 детерминированных элементов, EN+RU, три типа задач — извлечение с точным ground truth, классификация с закрытыми наборами меток, генерация по структурному контракту. Строгий парсинг JSON плюс поключевое сравнение разделяют успех парсинга и успех задачи; гейт повторов приближает детекцию циклов. Песочницы исполнения инструментов в этой ревизии нет.
- endurance-30m-v1 released
Деградирует ли система под длительной нагрузкой — и когда именно?
Гоняет человеческий корпус interactive-assistant-v2 closed-loop при concurrency 4 в течение 180 минут; пореквестные смещения старта дают 5-минутные окна с чекпоинтами на 30/60/180 мин; оконные межтокенная задержка, TTFT и успешность запросов; гейты формата, языка и повторов. «30m» в id — историческое: первый чекпоинт.
- rag-pipeline-ru-v0 Внутренний
Где именно русскоязычный RAG-пайплайн теряет качество, покомпонентно?
Покомпонентная оценка: OCR CER/WER → F1 границ сплиттера → Recall@k/nDCG → дельта реранкера → support/abstention/citations генерации. Внутренний до прохождения 6 release-гейтов.
- doc-session-v1 released
Платит ли второй вопрос по тому же вставленному документу полный префилл заново?
Клиентское время до первого токена для пар вопросов с бит-в-бит общим префиксом документа (1 warmup-элемент + 4 документа, 8k/32k токенов, EN+RU), с выключенным (база) и включённым кэшем промптов; гейты формата/языка/повторов на ответах.