# Երկրորդ մոդել, երկրորդ քվանտ, երկրորդ բեքենդ. ի՞նչ է տեղափոխվում մեկ արկղի վրա

> Նույն Strix Halo միավորը, երեք փոխարինում՝ մեկը միանգամից. մոդելների երկրորդ ընտանիքը վերարտադրում է դատարկ պատասխանների ռեժիմը; Q8_0-ն այս workload-ների վրա ոչ մի չափելի բան չի գնում; ROCm-ն աշխատում է gfx1151-ի վրա, բայց դեկոդում է Vulkan-ից դանդաղ։

- Published: 2026-08-03
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/model-quant-backend-strix-halo/

> **Ապացույցների մակարդակը՝ `lab_repeated`։** Յուրաքանչյուր թիվ նորից դուրս է
> բերվում հարցումների հում գրառումներից claim registry-ում նշված հարցումով։
> Երեք կրկնված անցում մեկ բջջին. փոխվում էր ուղիղ մեկ փոփոխական միանգամից՝
> նույն ամրագրված բազայի դիմաց (Qwen3.6-35B Q4_K_M, llama.cpp Vulkan, մեկ
> GTR9 Pro միավոր)։

## Ինչու է այս հետազոտությունը

Մեկ կոնֆիգուրացիայի վճիռը նրա հարևանների վճիռը չէ։ Այստեղ մեկ առ մեկ
փոխարինվում է ինքնության ուղիղ մեկ բաղադրիչ՝ մոդելի ընտանիքը, քվանտավորումը,
հաշվողական բեքենդը, — և չափվում է, թե ինչն է իրականում տեղափոխվում։

## Փոխարինում 1. մոդելների երկրորդ ընտանիքը վերարտադրում է խափանման ռեժիմը

Մեր նախորդ գտածոն. thinking-մոդելը սեղմ ավարտման բյուջեի դեպքում վերադարձնում
է HTTP 200՝ դատարկ պատասխանով։ gemma-4-26B-A4B-ի վրա լռելյայն ռեժիմում, 1024
թոքեն բյուջեով, կենցաղային հարցումների
**8.3 % of requests** ([strix.gemma4.interactive2.c1.answerless-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.answerless-default/))-ը
վերադարձան դատարկ՝ նույն պատճառով. մտորման անցումը կերավ բյուջեն։ Ավելի մեղմ,
քան Qwen-ի thinking-բջիջը, բայց էֆեկտը կա. **խափանման ռեժիմը մեկ մոդելային
ընտանիքի եզակի հատկությունը չէ** — չափված երկու ընտանիքներն էլ այն ցույց են
տալիս։ Արդյոք այն պահպանվում է reasoning-մոդելների վրա ընդհանրապես — հենց այն
է, ինչ այս կորպուսը ստեղծված է ստուգելու հաջորդիվ։ Պատասխանն այստեղ էլ հետ է
մնում հոսքից. հոսքի առաջին թոքենը գալիս է
**282 ms** ([strix.gemma4.interactive2.c1.ttft-any-token](https://agmind.ai/claims/strix.gemma4.interactive2.c1.ttft-any-token/))-ում, իսկ
*պատասխանի* առաջին թոքենը՝
**10768 ms** ([strix.gemma4.interactive2.c1.ttfa-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.ttfa-default/))-ում։

Մնացյալում gemma-ն նույն արկղի ընդունակ բնակիչ է. ասեղի որոնումը՝
**95.8 % of requests** ([strix.gemma4.longctx.c1.needle-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.needle-success/)) 2k–32k սանդուղքի
վրա, խիստ JSON-ի task success-ը՝
**93.8 % of requests** ([strix.gemma4.structured.c1.task-success](https://agmind.ai/claims/strix.gemma4.structured.c1.task-success/)) (ձախողումները
չպարսվող ելքեր են RU գեներացիայի խնդիրների վրա, ոչ թե սխալ արժեքներ), բայց
unanswerable-կոնտրոլների վրա պատասխանի բացակայության հստակ ընդունում նա տվեց
**75.0 % of requests** ([strix.gemma4.longctx.c1.control-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.control-success/)) դեպքերում։
Ձախողված քառորդը կոդեր չի հորինել — այդ հարցումները վերադարձրին դատարկ
պատասխաններ. reasoning-անցումը սպառեց ամբողջ թոքեն-բյուջեն։ Qwen3.6-ը
ամեն կոնտրոլին պատասխանեց հստակ հրաժարումով։

## Փոխարինում 2. Q8_0-ն չգնեց ոչինչ, ինչ տեսնում են այս workload-ները

35 ԳԲ Q8_0 արտեֆակտը 20 ԳԲ Q4_K_M-ի դիմաց, մտորումն անջատված. խիստ JSON-ի
task success-ը մնաց
**100.0 % of requests** ([strix.qwen36q8.vulkan.c1.task-success](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.task-success/))՝ նույնական
Q4_K_M-ին, իսկ դեկոդը դանդաղեց
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ից մինչև
**18.7 ms/token** ([strix.qwen36q8.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)) մեկ թոքենի հաշվով՝
հենվելով հիշողության թողունակության վրա, ինչպես և սպասվում է unified
LPDDR5X-ի դեպքում։ Այս workload-ների վրա ավելի մեծ քվանտը խստորեն ավելի վատ
գործարք է։ Սա պնդում է այս գեյթերի և կորպուսների մասին. այնտեղ, որտեղ
կոռեկտությունն ավելի բարդ է, քան չափում են մեր գեյթերը, որակի տարբերությունը
միանգամայն կարող է գոյություն ունենալ։

## Փոխարինում 3. ROCm-ն աշխատում է gfx1151-ի վրա, բայց ավելի դանդաղ

ROCm build-ն ավարտեց յուրաքանչյուր հարցում
(**100.0 % of requests** ([strix.qwen36q4.rocm.c1.task-success](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.task-success/)) խիստ JSON-ի վրա,
պատասխանի առաջին թոքենը՝
**215 ms** ([strix.qwen36q4.rocm.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.ttfa-nothink/))) — բեքենդը պիտանի է։
Բայց դեկոդն ընթանում էր
**18.7 ms/token** ([strix.qwen36q4.rocm.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.itl-nothink/)) մեկ թոքենին՝ Vulkan-ի
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ի դիմաց — այսօր
Vulkan-ն այս արկղի վրա ավելի արագ է։

Ուղղությունը համընկնում է լաբորատորիայի ավելի վաղ միայնակ smoke-անցման հետ
նույն բեքենդներով (սերվերային timings, արխիվը smoke-դատասեթում). վերևի
բջիջներն այդ ինդիկացիան վերածում են ռեգիստրով հաստատված կլիենտային թվերի՝
կրկնումներով։ Միայնակ ad-hoc ավարտումներն ապացույց չեն ոչ մի ուղղությամբ.
ապացույց են միայն փաթեթավորված անցումները։

## Ինչ սա չի հաստատում

gemma-ի մտորման անջատումը չի ստուգվել (փոխարկիչը կախված է chat template-ից)։
Երկու քվանտներն էլ հենվում են մեր կոռեկտության գեյթերի առաստաղին. ավելի բարդ
խնդիրները կարող էին դրանք բաժանել։ ROCm-ի պատկերը լողացող upstream թեգ է,
այստեղ ամրագրված է իր digest-ով։ 1–3 փոխարինումներն ընթացել են մեկ միավորի
վրա. միավոր-առ-միավոր ռեպլիկացիա ունի միայն բազային կոնֆիգուրացիան։ Այստեղ
ոչինչ Strix Halo-ն այլ սարքերի հետ չի համեմատում։

## Ապացույցներ

Յուրաքանչյուր անցում տվել է ստանդարտ փաթեթ (մանիֆեստ, գրառումներ յուրաքանչյուր
հարցումի համար՝ ներառյալ մերժումները, գեյթերի ելքերը, runtime-ի լոգ, ստուգիչ
գումարներ). վերևի թվերը նորից դուրս են բերվում այս գրառումներից CI-ում։
Harness-ը և կորպուսները՝ [agmind-bench](https://github.com/botAGI/agmind-bench)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
