# llama.cpp Vulkan против ROCm на AMD Strix Halo

Какой бэкенд llama.cpp запускать на машине с Ryzen AI Max+ 395 (gfx1151) для одиночного чата — Vulkan или ROCm?

Vulkan на этой конфигурации декодирует быстрее; время до первого токена ответа — фактически ничья. Оба бэкенда прошли все strict-JSON задачи структурного ворклоада, так что выбор — про темп декода и операционные предпочтения, а не про качество.

**Что было зафиксировано.** Один и тот же физический юнит (Beelink GTR9 Pro, 128 ГБ unified), один артефакт Qwen3.6-35B-A3B Q4_K_M по хэшу, один замороженный корпус человеческих задач, один поток, reasoning выключен. Отличается только контейнер бэкенда.

| Метрика | Vulkan | ROCm |
| --- | --- | --- |
| Межтокенная задержка, медиана (темп декода) | 15.9 ms/token ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) | 18.7 ms/token ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q4.rocm.c1.itl-nothink/)) |
| Время до первого токена ответа, медиана | 210 ms ([lab_unit_replicated](https://agmind.ai/ru/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)) | 215 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q4.rocm.c1.ttfa-nothink/)) |
| Успех strict-JSON задач (структурный ворклоад) | 100.0 % of requests ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.structured.c1.task-success-nothink/)) | 100.0 % of requests ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36q4.rocm.c1.task-success/)) |

## Ограничения

Один юнит, один артефакт модели, одна сборка runtime на бэкенд, один поток. Нагрузки с тяжёлым префиллом или множеством потоков могут расставить бэкенды иначе — меряйте свою ячейку перед выбором.

## Связанные доказательства

- https://agmind.ai/ru/reports/model-quant-backend-strix-halo/
- https://agmind.ai/ru/workloads/interactive-assistant-v2/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/ru/compare/llamacpp-vulkan-vs-rocm-strix-halo/
