Контролируемое сравнение
llama.cpp Vulkan против ROCm на AMD Strix Halo
Какой бэкенд llama.cpp запускать на машине с Ryzen AI Max+ 395 (gfx1151) для одиночного чата — Vulkan или ROCm?
Что было зафиксировано
Один и тот же физический юнит (Beelink GTR9 Pro, 128 ГБ unified), один артефакт Qwen3.6-35B-A3B Q4_K_M по хэшу, один замороженный корпус человеческих задач, один поток, reasoning выключен. Отличается только контейнер бэкенда.
| Метрика | Vulkan | ROCm |
|---|---|---|
| Межтокенная задержка, медиана (темп декода) | 15.9мс/токенmedian over valid requests · lab_repeated · доказательства | 18.7мс/токенmedian over valid requests · lab_repeated · доказательства |
| Время до первого токена ответа, медиана | 210мсmedian over valid requests · lab_unit_replicated · доказательства | 215мсmedian over valid requests · lab_repeated · доказательства |
| Успех strict-JSON задач (структурный ворклоад) | 100.0% запросовshare of all issued requests · lab_repeated · доказательства | 100.0% запросовshare of all issued requests · lab_repeated · доказательства |
Как это читать
Vulkan на этой конфигурации декодирует быстрее; время до первого токена ответа — фактически ничья. Оба бэкенда прошли все strict-JSON задачи структурного ворклоада, так что выбор — про темп декода и операционные предпочтения, а не про качество.
Ограничения
Один юнит, один артефакт модели, одна сборка runtime на бэкенд, один поток. Нагрузки с тяжёлым префиллом или множеством потоков могут расставить бэкенды иначе — меряйте свою ячейку перед выбором.
Отвечаете на этот вопрос где-то? Вставьте таблицу
Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.