Workload
structured-agent-v1
На какой вопрос отвечает
Надёжен ли строгий JSON-вывод в повседневных задачах автоматизации на этой системе?
Что измеряется
16 детерминированных элементов, EN+RU, три типа задач — извлечение с точным ground truth, классификация с закрытыми наборами меток, генерация по структурному контракту. Строгий парсинг JSON плюс поключевое сравнение разделяют успех парсинга и успех задачи; гейт повторов приближает детекцию циклов. Песочницы исполнения инструментов в этой ревизии нет.
Какие заявления этот workload поддержать не может
Заявления об «агентной готовности» по одному проценту парсинга; заявления о tool calling — эта ревизия не исполняет инструменты.
Замороженная идентичность
Каждая released-ревизия workload замораживает хэши элементов, модель нагрузки и quality-гейты. Результаты ссылаются на точную ревизию; изменение любого поля идентичности создаёт новую ревизию. Факты ниже читаются из файла каталога, а не набраны на странице.
- Ревизия
- 2026-08-03
- Модель нагрузки
- closed_loop
- Quality-гейты
- format_gate, repetition_gate, json_gate
- Контракт метрик
- task_success_rate, parse_success_rate, loop_detection_rate
- Хэш корпуса
- 9687fb0512b4…