Workload

interactive-assistant-v2

released

На какой вопрос отвечает

Отзывчив ли одиночный стриминговый чат на этой системе в повседневных человеческих задачах?

Что измеряется

Тот же контракт, что у v1 — клиентский TTFT, межтокенная задержка, e2e-время; гейты формата, языка и повторов — но на корпусе человеческих задач: повседневные запросы (сообщения, письма, объяснения, планы) вместо самореферентных бенчмарк-вопросов. 16 элементов, EN+RU, три диапазона длины.

Какие заявления этот workload поддержать не может

«Поддерживает N сотрудников», заявления о production-ёмкости.

Замороженная идентичность

Каждая released-ревизия workload замораживает хэши элементов, модель нагрузки и quality-гейты. Результаты ссылаются на точную ревизию; изменение любого поля идентичности создаёт новую ревизию. Факты ниже читаются из файла каталога, а не набраны на странице.

Ревизия
2026-08-02
Модель нагрузки
closed_loop
Quality-гейты
format_gate, language_gate, repetition_gate
Контракт метрик
ttft_ms, inter_token_latency_ms, e2e_ms
Хэш корпуса
660eaad10d3f…
← Библиотека workloads