Claim

gemma-4-26B-A4B-it Q4_0 Ryzen AI Max+ 395-ի վրա (llama.cpp Vulkan) — strict-JSON task success: 93.8 հարցումների %

active lab_repeated strix.gemma4.structured.c1.task-success

93.8հարցումների %

Չափումը

Beelink GTR9 Pro — AMD Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 GB LPDDR5X-8000 unified համակարգի վրա, llama.cpp (server, Vulkan backend), b9049 (server_fingerprint b9049-2496f9c14) runtime-ով և ggml-org/gemma-4-26B-A4B-it-GGUF @ bb4531cda34d (Q4_0) մոդելով չափված «strict-JSON task success» մեծությունը կազմել է 93.8 հարցումների % (share of all issued requests)։ Չափումը կատարվել է structured-agent-v1@2026-08-03 սառեցված workload-ի տակ; ապացույցի մակարդակը՝ lab_repeated, 3 վավեր գործարկում 1 ֆիզիկական յունիթի վրա։ Արժեքը վերաստացվում է գործարկումների հում գրառումներից ամեն CI build-ում։

Ձևակերպում

Share of strict-JSON automation requests whose output parsed and matched the ground truth per key, default operating mode.

Claim-երի ձևակերպումները հրապարակվում են միայն անգլերեն — սա կանոնական, մեջբերելի տարբերակն է։

Ապացույցներ

Համակարգ
Beelink GTR9 Pro — AMD Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 GB LPDDR5X-8000 unified
Runtime
llama.cpp (server, Vulkan backend), b9049 (server_fingerprint b9049-2496f9c14)
Մոդելի արտեֆակտ
ggml-org/gemma-4-26B-A4B-it-GGUF @ bb4531cda34d (Q4_0)
Շրջանակ
structured-agent-v1@2026-08-03
Ագրեգացիա
share of all issued requests
Ապացույցի մակարդակ
lab_repeated
Կարգավիճակ
active
Հրապարակված է
03 օգոստոսի, 2026 թ.
Սահմանափակումներ
Three repeated runs on one unit. Default operating mode of the model (reasoning emitted); disabling reasoning via the chat template was not tested for this model family. Failures were unparseable outputs on RU generation tasks, not wrong values.
Գործարկումներ

Արժեքի ստացումը

Արժեքն ամեն CI build-ում վերաստացվում է գործարկումների հում գրառումներից այս հարցումով — հրապարակված թիվը չի կարող լուռ շեղվել իր ապացույցներից։

catalog/claims/sql/json-task-success.sql

Որտեղ է մեջբերվում

Կայքի էջերը, որտեղ այս թիվն է ցուցադրվում.

Չափված զույգեր

Ինչպես մեջբերել

AGmind Systems Lab. gemma-4-26B-A4B-it Q4_0 on Ryzen AI Max+ 395 (llama.cpp Vulkan): strict-JSON task success — 93.8 % of requests (share of all issued requests; 3 runs on 1 unit; evidence level lab_repeated; workload structured-agent-v1@2026-08-03). Claim strix.gemma4.structured.c1.task-success. https://agmind.ai/claims/strix.gemma4.structured.c1.task-success/
@misc{agmind_strix_gemma4_structured_c1_task_success,
  author       = {{AGmind Systems Lab}},
  title        = {Share of strict-JSON automation requests whose output parsed and matched the ground truth per key, default operating mode.},
  howpublished = {\url{https://agmind.ai/claims/strix.gemma4.structured.c1.task-success/}},
  note         = {Claim strix.gemma4.structured.c1.task-success: 93.8 \% of requests; evidence level lab\_repeated; scope structured-agent-v1@2026-08-03},
  year         = {2026}
}

Մեքենայաընթեռնելի. /claims/strix.gemma4.structured.c1.task-success.json · BibTeX · CSL-JSON · ամբողջ ռեեստրը · փոփոխությունների հոսք

Ունե՞ք համադրելի սարքաշար։ Այս claim-ը կարելի է վերարտադրել. /reproduce/

Հրապարակված արդյունքների ուղղումները արձանագրվում են հրապարակայնորեն. errata

← Բոլոր claim-երը