Հաշվետվություն

Երկրորդ մոդել, երկրորդ քվանտ, երկրորդ բեքենդ. ի՞նչ է տեղափոխվում մեկ արկղի վրա

Նույն Strix Halo միավորը, երեք փոխարինում՝ մեկը միանգամից. մոդելների երկրորդ ընտանիքը վերարտադրում է դատարկ պատասխանների ռեժիմը; Q8_0-ն այս workload-ների վրա ոչ մի չափելի բան չի գնում; ROCm-ն աշխատում է gfx1151-ի վրա, բայց դեկոդում է Vulkan-ից դանդաղ։

lab_repeated internal research 03 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Ապացույցների մակարդակը՝ lab_repeated։ Յուրաքանչյուր թիվ նորից դուրս է բերվում հարցումների հում գրառումներից claim registry-ում նշված հարցումով։ Երեք կրկնված անցում մեկ բջջին. փոխվում էր ուղիղ մեկ փոփոխական միանգամից՝ նույն ամրագրված բազայի դիմաց (Qwen3.6-35B Q4_K_M, llama.cpp Vulkan, մեկ GTR9 Pro միավոր)։

Ինչու է այս հետազոտությունը

Մեկ կոնֆիգուրացիայի վճիռը նրա հարևանների վճիռը չէ։ Այստեղ մեկ առ մեկ փոխարինվում է ինքնության ուղիղ մեկ բաղադրիչ՝ մոդելի ընտանիքը, քվանտավորումը, հաշվողական բեքենդը, — և չափվում է, թե ինչն է իրականում տեղափոխվում։

Փոխարինում 1. մոդելների երկրորդ ընտանիքը վերարտադրում է խափանման ռեժիմը

Մեր նախորդ գտածոն. thinking-մոդելը սեղմ ավարտման բյուջեի դեպքում վերադարձնում է HTTP 200՝ դատարկ պատասխանով։ gemma-4-26B-A4B-ի վրա լռելյայն ռեժիմում, 1024 թոքեն բյուջեով, կենցաղային հարցումների 8.3հարցումների %repeated-ը վերադարձան դատարկ՝ նույն պատճառով. մտորման անցումը կերավ բյուջեն։ Ավելի մեղմ, քան Qwen-ի thinking-բջիջը, բայց էֆեկտը կա. խափանման ռեժիմը մեկ մոդելային ընտանիքի եզակի հատկությունը չէ — չափված երկու ընտանիքներն էլ այն ցույց են տալիս։ Արդյոք այն պահպանվում է reasoning-մոդելների վրա ընդհանրապես — հենց այն է, ինչ այս կորպուսը ստեղծված է ստուգելու հաջորդիվ։ Պատասխանն այստեղ էլ հետ է մնում հոսքից. հոսքի առաջին թոքենը գալիս է 282մվrepeated-ում, իսկ պատասխանի առաջին թոքենը՝ 10768մվrepeated-ում։

Մնացյալում gemma-ն նույն արկղի ընդունակ բնակիչ է. ասեղի որոնումը՝ 95.8հարցումների %repeated 2k–32k սանդուղքի վրա, խիստ JSON-ի task success-ը՝ 93.8հարցումների %repeated (ձախողումները չպարսվող ելքեր են RU գեներացիայի խնդիրների վրա, ոչ թե սխալ արժեքներ), բայց unanswerable-կոնտրոլների վրա պատասխանի բացակայության հստակ ընդունում նա տվեց 75.0հարցումների %repeated դեպքերում։ Ձախողված քառորդը կոդեր չի հորինել — այդ հարցումները վերադարձրին դատարկ պատասխաններ. reasoning-անցումը սպառեց ամբողջ թոքեն-բյուջեն։ Qwen3.6-ը ամեն կոնտրոլին պատասխանեց հստակ հրաժարումով։

Փոխարինում 2. Q8_0-ն չգնեց ոչինչ, ինչ տեսնում են այս workload-ները

35 ԳԲ Q8_0 արտեֆակտը 20 ԳԲ Q4_K_M-ի դիմաց, մտորումն անջատված. խիստ JSON-ի task success-ը մնաց 100.0հարցումների %repeated՝ նույնական Q4_K_M-ին, իսկ դեկոդը դանդաղեց 15.9մվ/թոքենrepeated-ից մինչև 18.7մվ/թոքենrepeated մեկ թոքենի հաշվով՝ հենվելով հիշողության թողունակության վրա, ինչպես և սպասվում է unified LPDDR5X-ի դեպքում։ Այս workload-ների վրա ավելի մեծ քվանտը խստորեն ավելի վատ գործարք է։ Սա պնդում է այս գեյթերի և կորպուսների մասին. այնտեղ, որտեղ կոռեկտությունն ավելի բարդ է, քան չափում են մեր գեյթերը, որակի տարբերությունը միանգամայն կարող է գոյություն ունենալ։

Փոխարինում 3. ROCm-ն աշխատում է gfx1151-ի վրա, բայց ավելի դանդաղ

ROCm build-ն ավարտեց յուրաքանչյուր հարցում (100.0հարցումների %repeated խիստ JSON-ի վրա, պատասխանի առաջին թոքենը՝ 215մվrepeated) — բեքենդը պիտանի է։ Բայց դեկոդն ընթանում էր 18.7մվ/թոքենrepeated մեկ թոքենին՝ Vulkan-ի 15.9մվ/թոքենrepeated-ի դիմաց — այսօր Vulkan-ն այս արկղի վրա ավելի արագ է։

Ուղղությունը համընկնում է լաբորատորիայի ավելի վաղ միայնակ smoke-անցման հետ նույն բեքենդներով (սերվերային timings, արխիվը smoke-դատասեթում). վերևի բջիջներն այդ ինդիկացիան վերածում են ռեգիստրով հաստատված կլիենտային թվերի՝ կրկնումներով։ Միայնակ ad-hoc ավարտումներն ապացույց չեն ոչ մի ուղղությամբ. ապացույց են միայն փաթեթավորված անցումները։

Ինչ սա չի հաստատում

gemma-ի մտորման անջատումը չի ստուգվել (փոխարկիչը կախված է chat template-ից)։ Երկու քվանտներն էլ հենվում են մեր կոռեկտության գեյթերի առաստաղին. ավելի բարդ խնդիրները կարող էին դրանք բաժանել։ ROCm-ի պատկերը լողացող upstream թեգ է, այստեղ ամրագրված է իր digest-ով։ 1–3 փոխարինումներն ընթացել են մեկ միավորի վրա. միավոր-առ-միավոր ռեպլիկացիա ունի միայն բազային կոնֆիգուրացիան։ Այստեղ ոչինչ Strix Halo-ն այլ սարքերի հետ չի համեմատում։

Ապացույցներ

Յուրաքանչյուր անցում տվել է ստանդարտ փաթեթ (մանիֆեստ, գրառումներ յուրաքանչյուր հարցումի համար՝ ներառյալ մերժումները, գեյթերի ելքերը, runtime-ի լոգ, ստուգիչ գումարներ). վերևի թվերը նորից դուրս են բերվում այս գրառումներից CI-ում։ Harness-ը և կորպուսները՝ agmind-bench։

Առնչվող ստուգված կոնֆիգուրացիաներ

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-03). Երկրորդ մոդել, երկրորդ քվանտ, երկրորդ բեքենդ. ի՞նչ է տեղափոխվում մեկ արկղի վրա. Evidence level: lab_repeated. https://agmind.ai/hy/reports/model-quant-backend-strix-halo/
← Հաշվետվություններ