Измерено

Qwen3.6-35B-A3B Q4_K_M на Ryzen AI Max+ 395 — все измеренные цифры

Всё, что лаборатория измерила для Qwen3.6-35B-A3B Q4_K_M на Ryzen AI Max+ 395: 32 клеймов по 6 замороженным ворклоадам, бэкенды llama.cpp ROCm и llama.cpp Vulkan. Каждая цифра ведёт на постоянную страницу клейма со скоупом, ограничениями и запечатанными доказательствами прогонов — значения перевыводятся из сырых записей в CI.

doc-session-v1@2026-08-03

Метрика Значение Доказательность Клейм
time to first token, first question over a 32k document · llama.cpp Vulkan 33940 мс lab_repeated strix.qwen36.docsession.c1.ttft-q1-32k
time to first token, second question with prompt cache on · llama.cpp Vulkan 860 мс lab_repeated strix.qwen36.docsession.c1.ttft-q2-32k-cache
time to first token, second question with prompt cache off · llama.cpp Vulkan 33728 мс lab_repeated strix.qwen36.docsession.c1.ttft-q2-32k-nocache
time to first token, second question over an 8k document, cache on · llama.cpp Vulkan 660 мс lab_repeated strix.qwen36.docsession.c1.ttft-q2-8k-cache

endurance-30m-v1@2026-08-03

Метрика Значение Доказательность Клейм
request completion over three hours (конкурентность 4) · llama.cpp Vulkan 100.0 % запросов lab_single_run strix.qwen36.endurance.c4.completion-180m
decode-pace drift over three hours (конкурентность 4) · llama.cpp Vulkan 1.6 % lab_single_run strix.qwen36.endurance.c4.itl-drift-180m
inter-token latency (конкурентность 4) · llama.cpp Vulkan 30.0 мс/токен lab_single_run strix.qwen36.endurance.c4.itl-median

interactive-assistant-v1@2026-08-02

Метрика Значение Доказательность Клейм
answerless (empty) responses at a 1k budget · llama.cpp Vulkan 75.0 % запросов lab_repeated strix.qwen36.interactive.c1.answerless-1k
time to first answer token · llama.cpp Vulkan 220 мс lab_repeated strix.qwen36.interactive.c1.ttfa-nothink
time to first answer token with reasoning on · llama.cpp Vulkan 23453 мс lab_repeated strix.qwen36.interactive.c1.ttfa-thinking
time to the first token of any output · llama.cpp Vulkan 221 мс lab_repeated strix.qwen36.interactive.c1.ttft-any-token

interactive-assistant-v2@2026-08-02

Метрика Значение Доказательность Клейм
answerless (empty) responses at a 1k budget · llama.cpp Vulkan 58.3 % запросов lab_unit_replicated strix.qwen36.interactive2.c1.answerless-1k
request completion · llama.cpp Vulkan 100.0 % запросов lab_unit_replicated strix.qwen36.interactive2.c1.completion-nothink
time to first answer token · llama.cpp Vulkan 210 мс lab_unit_replicated strix.qwen36.interactive2.c1.ttfa-nothink
time to first answer token with reasoning on · llama.cpp Vulkan 20191 мс lab_unit_replicated strix.qwen36.interactive2.c1.ttfa-thinking
time to the first token of any output · llama.cpp Vulkan 212 мс lab_unit_replicated strix.qwen36.interactive2.c1.ttft-any-token
request completion (конкурентность 4) · llama.cpp Vulkan 100.0 % запросов lab_repeated strix.qwen36.interactive2.c4.completion-nothink
time to first answer token (конкурентность 4) · llama.cpp Vulkan 338 мс lab_repeated strix.qwen36.interactive2.c4.ttfa-nothink
request completion (конкурентность 8) · llama.cpp Vulkan 100.0 % запросов lab_repeated strix.qwen36.interactive2.c8.completion-nothink
time to first answer token (конкурентность 8) · llama.cpp Vulkan 865 мс lab_repeated strix.qwen36.interactive2.c8.ttfa-nothink
inter-token latency · llama.cpp ROCm 18.7 мс/токен lab_repeated strix.qwen36q4.rocm.c1.itl-nothink
time to first answer token · llama.cpp ROCm 215 мс lab_repeated strix.qwen36q4.rocm.c1.ttfa-nothink
inter-token latency · llama.cpp Vulkan 15.9 мс/токен lab_repeated strix.qwen36q4.vulkan.c1.itl-nothink

long-context-v1@2026-08-03

Метрика Значение Доказательность Клейм
unanswerable-control honesty · llama.cpp Vulkan 100.0 % запросов lab_unit_replicated strix.qwen36.longctx.c1.control-success
needle retrieval success · llama.cpp Vulkan 100.0 % запросов lab_repeated strix.qwen36.longctx.c1.needle-success
time to first token at a 2k-token document · llama.cpp Vulkan 1907 мс lab_repeated strix.qwen36.longctx.c1.ttft-2k-en
time to first token at a 32k-token document · llama.cpp Vulkan 33965 мс lab_repeated strix.qwen36.longctx.c1.ttft-32k-en

structured-agent-v1@2026-08-03

Метрика Значение Доказательность Клейм
end-to-end time to a complete answer · llama.cpp Vulkan 844 мс lab_repeated strix.qwen36.structured.c1.e2e-nothink
end-to-end time with reasoning on · llama.cpp Vulkan 14677 мс lab_repeated strix.qwen36.structured.c1.e2e-think4k
strict-JSON task success · llama.cpp Vulkan 100.0 % запросов lab_repeated strix.qwen36.structured.c1.task-success-nothink
strict-JSON task success with reasoning on · llama.cpp Vulkan 100.0 % запросов lab_repeated strix.qwen36.structured.c1.task-success-think4k
strict-JSON task success · llama.cpp ROCm 100.0 % запросов lab_repeated strix.qwen36q4.rocm.c1.task-success

Как читать эту страницу

Это ограниченные скоупом измерения, а не рейтинг. Вердикт по ворклоаду живёт на карточке проверенной конфигурации; цифра без своих ограничений несравнима между системами. Формулировки клеймов каноничны на английском.

С чего начать: /tested-configurations/ /compare/ /claims/