Клейм

gemma-4-26B-A4B-it Q4_0 на Ryzen AI Max+ 395 (llama.cpp Vulkan) — strict-JSON task success: 93.8 % запросов

active lab_repeated strix.gemma4.structured.c1.task-success

93.8% запросов

Измерение

На системе Beelink GTR9 Pro — AMD Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 GB LPDDR5X-8000 unified под управлением llama.cpp (server, Vulkan backend), b9049 (server_fingerprint b9049-2496f9c14) с моделью ggml-org/gemma-4-26B-A4B-it-GGUF @ bb4531cda34d (Q4_0) измеренная величина «strict-JSON task success» составила 93.8 % запросов (share of all issued requests). Измерение выполнено под замороженным ворклоадом structured-agent-v1@2026-08-03; уровень доказательности — lab_repeated, 3 валидных прогонов на 1 физическом(-их) юните(-ах). Значение перевыводится из сырых записей прогонов на каждом CI-билде.

Формулировка

Share of strict-JSON automation requests whose output parsed and matched the ground truth per key, default operating mode.

Формулировки клеймов публикуются только на английском — это каноничная цитируемая версия.

Доказательства

Система
Beelink GTR9 Pro — AMD Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 GB LPDDR5X-8000 unified
Runtime
llama.cpp (server, Vulkan backend), b9049 (server_fingerprint b9049-2496f9c14)
Артефакт модели
ggml-org/gemma-4-26B-A4B-it-GGUF @ bb4531cda34d (Q4_0)
Скоуп
structured-agent-v1@2026-08-03
Агрегация
share of all issued requests
Уровень доказательности
lab_repeated
Статус
active
Опубликовано
3 августа 2026 г.
Ограничения
Three repeated runs on one unit. Default operating mode of the model (reasoning emitted); disabling reasoning via the chat template was not tested for this model family. Failures were unparseable outputs on RU generation tasks, not wrong values.
Прогоны

Вывод значения

Значение перевыводится из сырых записей прогонов этим запросом на каждом CI-билде — опубликованная цифра не может тихо разойтись со своими данными.

catalog/claims/sql/json-task-success.sql

Где цитируется

Страницы сайта, на которых выводится это число:

Измеренные пары

Как цитировать

AGmind Systems Lab. gemma-4-26B-A4B-it Q4_0 on Ryzen AI Max+ 395 (llama.cpp Vulkan): strict-JSON task success — 93.8 % of requests (share of all issued requests; 3 runs on 1 unit; evidence level lab_repeated; workload structured-agent-v1@2026-08-03). Claim strix.gemma4.structured.c1.task-success. https://agmind.ai/claims/strix.gemma4.structured.c1.task-success/
@misc{agmind_strix_gemma4_structured_c1_task_success,
  author       = {{AGmind Systems Lab}},
  title        = {Share of strict-JSON automation requests whose output parsed and matched the ground truth per key, default operating mode.},
  howpublished = {\url{https://agmind.ai/claims/strix.gemma4.structured.c1.task-success/}},
  note         = {Claim strix.gemma4.structured.c1.task-success: 93.8 \% of requests; evidence level lab\_repeated; scope structured-agent-v1@2026-08-03},
  year         = {2026}
}

Машиночитаемо: /claims/strix.gemma4.structured.c1.task-success.json · BibTeX · CSL-JSON · весь реестр · лента изменений

Есть сопоставимое железо? Этот клейм можно воспроизвести: /reproduce/

Исправления опубликованных результатов фиксируются публично: errata

← Все клеймы