Контролируемое сравнение

llama.cpp Vulkan против ROCm на AMD Strix Halo

Какой бэкенд llama.cpp запускать на машине с Ryzen AI Max+ 395 (gfx1151) для одиночного чата — Vulkan или ROCm?

Что было зафиксировано

Один и тот же физический юнит (Beelink GTR9 Pro, 128 ГБ unified), один артефакт Qwen3.6-35B-A3B Q4_K_M по хэшу, один замороженный корпус человеческих задач, один поток, reasoning выключен. Отличается только контейнер бэкенда.

Метрика Vulkan ROCm
Межтокенная задержка, медиана (темп декода) 15.9мс/токенmedian over valid requests · lab_repeated · доказательства 18.7мс/токенmedian over valid requests · lab_repeated · доказательства
Время до первого токена ответа, медиана 210мсmedian over valid requests · lab_unit_replicated · доказательства 215мсmedian over valid requests · lab_repeated · доказательства
Успех strict-JSON задач (структурный ворклоад) 100.0% запросовshare of all issued requests · lab_repeated · доказательства 100.0% запросовshare of all issued requests · lab_repeated · доказательства

Как это читать

Vulkan на этой конфигурации декодирует быстрее; время до первого токена ответа — фактически ничья. Оба бэкенда прошли все strict-JSON задачи структурного ворклоада, так что выбор — про темп декода и операционные предпочтения, а не про качество.

Ограничения

Один юнит, один артефакт модели, одна сборка runtime на бэкенд, один поток. Нагрузки с тяжёлым префиллом или множеством потоков могут расставить бэкенды иначе — меряйте свою ячейку перед выбором.

Отвечаете на этот вопрос где-то? Вставьте таблицу

Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.

Связанные доказательства

← Все сравнения