Workload

structured-agent-v1

released

На какой вопрос отвечает

Надёжен ли строгий JSON-вывод в повседневных задачах автоматизации на этой системе?

Что измеряется

16 детерминированных элементов, EN+RU, три типа задач — извлечение с точным ground truth, классификация с закрытыми наборами меток, генерация по структурному контракту. Строгий парсинг JSON плюс поключевое сравнение разделяют успех парсинга и успех задачи; гейт повторов приближает детекцию циклов. Песочницы исполнения инструментов в этой ревизии нет.

Какие заявления этот workload поддержать не может

Заявления об «агентной готовности» по одному проценту парсинга; заявления о tool calling — эта ревизия не исполняет инструменты.

Замороженная идентичность

Каждая released-ревизия workload замораживает хэши элементов, модель нагрузки и quality-гейты. Результаты ссылаются на точную ревизию; изменение любого поля идентичности создаёт новую ревизию. Факты ниже читаются из файла каталога, а не набраны на странице.

Ревизия
2026-08-03
Модель нагрузки
closed_loop
Quality-гейты
format_gate, repetition_gate, json_gate
Контракт метрик
task_success_rate, parse_success_rate, loop_detection_rate
Хэш корпуса
9687fb0512b4…
← Библиотека workloads