Workload
interactive-assistant-v2
released
На какой вопрос отвечает
Отзывчив ли одиночный стриминговый чат на этой системе в повседневных человеческих задачах?
Что измеряется
Тот же контракт, что у v1 — клиентский TTFT, межтокенная задержка, e2e-время; гейты формата, языка и повторов — но на корпусе человеческих задач: повседневные запросы (сообщения, письма, объяснения, планы) вместо самореферентных бенчмарк-вопросов. 16 элементов, EN+RU, три диапазона длины.
Какие заявления этот workload поддержать не может
«Поддерживает N сотрудников», заявления о production-ёмкости.
Замороженная идентичность
Каждая released-ревизия workload замораживает хэши элементов, модель нагрузки и quality-гейты. Результаты ссылаются на точную ревизию; изменение любого поля идентичности создаёт новую ревизию. Факты ниже читаются из файла каталога, а не набраны на странице.
- Ревизия
- 2026-08-02
- Модель нагрузки
- closed_loop
- Quality-гейты
- format_gate, language_gate, repetition_gate
- Контракт метрик
- ttft_ms, inter_token_latency_ms, e2e_ms
- Хэш корпуса
- 660eaad10d3f…