Վերահսկվող համեմատություն
llama.cpp Vulkan-ն ընդդեմ ROCm-ի AMD Strix Halo-ի վրա
llama.cpp-ի ո՞ր backend-ը գործարկել Ryzen AI Max+ 395 (gfx1151) մեքենայի վրա մեկ օգտատիրոջ չաթի համար — Vulkan, թե՞ ROCm։
Ինչն էր ֆիքսված
Նույն ֆիզիկական յունիթը (Beelink GTR9 Pro, 128 ԳԲ unified), նույն Qwen3.6-35B-A3B Q4_K_M արտեֆակտն ըստ հեշի, նույն սառեցված կորպուսը, մեկ հոսք, reasoning-ն անջատած։ Տարբերվում է միայն backend-կոնտեյները։
| Մետրիկա | Vulkan | ROCm |
|---|---|---|
| Միջթոքենային ուշացում, մեդիան (դեկոդի տեմպ) | 15.9մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ | 18.7մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ |
| Ժամանակ մինչև պատասխանի առաջին թոքենը, մեդիան | 210մվmedian over valid requests · lab_unit_replicated · ապացույցներ | 215մվmedian over valid requests · lab_repeated · ապացույցներ |
| Strict-JSON խնդիրների հաջողություն (structured workload) | 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ | 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ |
Ինչպես կարդալ սա
Vulkan-ն այս կոնֆիգուրացիայում ավելի արագ է դեկոդավորում; ժամանակը մինչև պատասխանի առաջին թոքենը փաստացի հավասար է։ Երկու backend-ներն էլ անցել են structured workload-ի բոլոր strict-JSON խնդիրները, ուստի ընտրությունը դեկոդի տեմպի և օպերացիոն նախապատվության հարց է, ոչ թե որակի։
Սահմանափակումներ
Մեկ յունիթ, մեկ մոդելի արտեֆակտ, մեկ runtime build ամեն backend-ի համար, մեկ հոսք։ Prefill-ով ծանր կամ բազմահոսք բեռները կարող են backend-ներն այլ կերպ դասավորել — չափեք ձեր բջիջը մինչև ընտրելը։
Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը
Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։