Չափված
Qwen3.6-35B-A3B Q4_K_M Ryzen AI Max+ 395-ի վրա — բոլոր չափված թվերը
Այն ամենը, ինչ լաբորատորիան չափել է Qwen3.6-35B-A3B Q4_K_M-ի համար Ryzen AI Max+ 395-ի վրա. 32 claim 6 սառեցված workload-ներով, backend-ներ՝ llama.cpp ROCm և llama.cpp Vulkan։ Ամեն թիվ տանում է դեպի իր մշտական claim-էջը՝ շրջանակով, սահմանափակումներով և կնքված գործարկումների ապացույցներով; արժեքները վերաստացվում են հում գրառումներից CI-ում։
doc-session-v1@2026-08-03
| Մետրիկա | Արժեք | Ապացույց | Claim |
|---|---|---|---|
| time to first token, first question over a 32k document · llama.cpp Vulkan | 33940 մվ | lab_repeated | strix.qwen36.docsession.c1.ttft-q1-32k |
| time to first token, second question with prompt cache on · llama.cpp Vulkan | 860 մվ | lab_repeated | strix.qwen36.docsession.c1.ttft-q2-32k-cache |
| time to first token, second question with prompt cache off · llama.cpp Vulkan | 33728 մվ | lab_repeated | strix.qwen36.docsession.c1.ttft-q2-32k-nocache |
| time to first token, second question over an 8k document, cache on · llama.cpp Vulkan | 660 մվ | lab_repeated | strix.qwen36.docsession.c1.ttft-q2-8k-cache |
endurance-30m-v1@2026-08-03
| Մետրիկա | Արժեք | Ապացույց | Claim |
|---|---|---|---|
| request completion over three hours (զուգահեռություն 4) · llama.cpp Vulkan | 100.0 հարցումների % | lab_single_run | strix.qwen36.endurance.c4.completion-180m |
| decode-pace drift over three hours (զուգահեռություն 4) · llama.cpp Vulkan | 1.6 % | lab_single_run | strix.qwen36.endurance.c4.itl-drift-180m |
| inter-token latency (զուգահեռություն 4) · llama.cpp Vulkan | 30.0 մվ/թոքեն | lab_single_run | strix.qwen36.endurance.c4.itl-median |
interactive-assistant-v1@2026-08-02
| Մետրիկա | Արժեք | Ապացույց | Claim |
|---|---|---|---|
| answerless (empty) responses at a 1k budget · llama.cpp Vulkan | 75.0 հարցումների % | lab_repeated | strix.qwen36.interactive.c1.answerless-1k |
| time to first answer token · llama.cpp Vulkan | 220 մվ | lab_repeated | strix.qwen36.interactive.c1.ttfa-nothink |
| time to first answer token with reasoning on · llama.cpp Vulkan | 23453 մվ | lab_repeated | strix.qwen36.interactive.c1.ttfa-thinking |
| time to the first token of any output · llama.cpp Vulkan | 221 մվ | lab_repeated | strix.qwen36.interactive.c1.ttft-any-token |
interactive-assistant-v2@2026-08-02
| Մետրիկա | Արժեք | Ապացույց | Claim |
|---|---|---|---|
| answerless (empty) responses at a 1k budget · llama.cpp Vulkan | 58.3 հարցումների % | lab_unit_replicated | strix.qwen36.interactive2.c1.answerless-1k |
| request completion · llama.cpp Vulkan | 100.0 հարցումների % | lab_unit_replicated | strix.qwen36.interactive2.c1.completion-nothink |
| time to first answer token · llama.cpp Vulkan | 210 մվ | lab_unit_replicated | strix.qwen36.interactive2.c1.ttfa-nothink |
| time to first answer token with reasoning on · llama.cpp Vulkan | 20191 մվ | lab_unit_replicated | strix.qwen36.interactive2.c1.ttfa-thinking |
| time to the first token of any output · llama.cpp Vulkan | 212 մվ | lab_unit_replicated | strix.qwen36.interactive2.c1.ttft-any-token |
| request completion (զուգահեռություն 4) · llama.cpp Vulkan | 100.0 հարցումների % | lab_repeated | strix.qwen36.interactive2.c4.completion-nothink |
| time to first answer token (զուգահեռություն 4) · llama.cpp Vulkan | 338 մվ | lab_repeated | strix.qwen36.interactive2.c4.ttfa-nothink |
| request completion (զուգահեռություն 8) · llama.cpp Vulkan | 100.0 հարցումների % | lab_repeated | strix.qwen36.interactive2.c8.completion-nothink |
| time to first answer token (զուգահեռություն 8) · llama.cpp Vulkan | 865 մվ | lab_repeated | strix.qwen36.interactive2.c8.ttfa-nothink |
| inter-token latency · llama.cpp ROCm | 18.7 մվ/թոքեն | lab_repeated | strix.qwen36q4.rocm.c1.itl-nothink |
| time to first answer token · llama.cpp ROCm | 215 մվ | lab_repeated | strix.qwen36q4.rocm.c1.ttfa-nothink |
| inter-token latency · llama.cpp Vulkan | 15.9 մվ/թոքեն | lab_repeated | strix.qwen36q4.vulkan.c1.itl-nothink |
long-context-v1@2026-08-03
| Մետրիկա | Արժեք | Ապացույց | Claim |
|---|---|---|---|
| unanswerable-control honesty · llama.cpp Vulkan | 100.0 հարցումների % | lab_unit_replicated | strix.qwen36.longctx.c1.control-success |
| needle retrieval success · llama.cpp Vulkan | 100.0 հարցումների % | lab_repeated | strix.qwen36.longctx.c1.needle-success |
| time to first token at a 2k-token document · llama.cpp Vulkan | 1907 մվ | lab_repeated | strix.qwen36.longctx.c1.ttft-2k-en |
| time to first token at a 32k-token document · llama.cpp Vulkan | 33965 մվ | lab_repeated | strix.qwen36.longctx.c1.ttft-32k-en |
structured-agent-v1@2026-08-03
| Մետրիկա | Արժեք | Ապացույց | Claim |
|---|---|---|---|
| end-to-end time to a complete answer · llama.cpp Vulkan | 844 մվ | lab_repeated | strix.qwen36.structured.c1.e2e-nothink |
| end-to-end time with reasoning on · llama.cpp Vulkan | 14677 մվ | lab_repeated | strix.qwen36.structured.c1.e2e-think4k |
| strict-JSON task success · llama.cpp Vulkan | 100.0 հարցումների % | lab_repeated | strix.qwen36.structured.c1.task-success-nothink |
| strict-JSON task success with reasoning on · llama.cpp Vulkan | 100.0 հարցումների % | lab_repeated | strix.qwen36.structured.c1.task-success-think4k |
| strict-JSON task success · llama.cpp ROCm | 100.0 հարցումների % | lab_repeated | strix.qwen36q4.rocm.c1.task-success |
Ինչպես կարդալ այս էջը
Սրանք շրջանակով սահմանափակված չափումներ են, ոչ թե վարկանիշ։ Workload-ի վճիռն ապրում է ստուգված կոնֆիգուրացիայի քարտի վրա; թիվն առանց իր սահմանափակումների համեմատելի չէ համակարգերի միջև։ Claim-երի ձևակերպումները կանոնական են անգլերենով։