Վերահսկվող համեմատություն

llama.cpp Vulkan-ն ընդդեմ ROCm-ի AMD Strix Halo-ի վրա

llama.cpp-ի ո՞ր backend-ը գործարկել Ryzen AI Max+ 395 (gfx1151) մեքենայի վրա մեկ օգտատիրոջ չաթի համար — Vulkan, թե՞ ROCm։

Ինչն էր ֆիքսված

Նույն ֆիզիկական յունիթը (Beelink GTR9 Pro, 128 ԳԲ unified), նույն Qwen3.6-35B-A3B Q4_K_M արտեֆակտն ըստ հեշի, նույն սառեցված կորպուսը, մեկ հոսք, reasoning-ն անջատած։ Տարբերվում է միայն backend-կոնտեյները։

Մետրիկա Vulkan ROCm
Միջթոքենային ուշացում, մեդիան (դեկոդի տեմպ) 15.9մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ 18.7մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ
Ժամանակ մինչև պատասխանի առաջին թոքենը, մեդիան 210մվmedian over valid requests · lab_unit_replicated · ապացույցներ 215մվmedian over valid requests · lab_repeated · ապացույցներ
Strict-JSON խնդիրների հաջողություն (structured workload) 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ

Ինչպես կարդալ սա

Vulkan-ն այս կոնֆիգուրացիայում ավելի արագ է դեկոդավորում; ժամանակը մինչև պատասխանի առաջին թոքենը փաստացի հավասար է։ Երկու backend-ներն էլ անցել են structured workload-ի բոլոր strict-JSON խնդիրները, ուստի ընտրությունը դեկոդի տեմպի և օպերացիոն նախապատվության հարց է, ոչ թե որակի։

Սահմանափակումներ

Մեկ յունիթ, մեկ մոդելի արտեֆակտ, մեկ runtime build ամեն backend-ի համար, մեկ հոսք։ Prefill-ով ծանր կամ բազմահոսք բեռները կարող են backend-ներն այլ կերպ դասավորել — չափեք ձեր բջիջը մինչև ընտրելը։

Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը

Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։

Առնչվող ապացույցներ

← Բոլոր համեմատությունները