Ստուգված կոնֆիգուրացիա

Strix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — կենցաղային օգնական

Մեկ օգտատիրոջ կենցաղային չաթ Beelink GTR9 Pro-ի վրա. ակնթարթային պատասխաններ առանց մտածողության, կոտրված կոնֆիգուրացիա մտածողության լռելյայն բյուջեով և բազմախոսության շեմ, որը չի անցնում ոչ մի ռեժիմում։

PARTIAL active lab_repeated

Կոնֆիգուրացիայի ճշգրիտ մատնահետք

ՀամակարգBeelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ԳԲ unified — մեկ օգտատիրոջ բջիջները ռեպլիկացված են երկրորդ՝ կոմերցիոն առումով նույնական յունիթի վրա
Runtimellama.cpp server-vulkan-b9049, պատկերի digest-ը ֆիքսված է՝ sha256:e359c012…
ՄոդելQwen3.6-35B-A3B Q4_K_M (ggml-org, ամրագրված ռևիզիա, sha256:671e47e0…)
Workloadinteractive-assistant-v2 @ 2026-08-02 — 16 կենցաղային խնդիր, EN+RU
Ռեժիմinternal research
ՖինանսավորումՍեփական ֆինանսավորում, ներքին հետազոտություն

Վճիռը վերաբերում է միայն վերևում նշված ճշգրիտ կոնֆիգուրացիային և workload-ի ռևիզիային։ Այն չի նշանակում նույն սարքի firmware-ի, դրայվերի, runtime-ի կամ մոդելի այլ տարբերակների աջակցություն։

Ի՞նչ հարցի է պատասխանում քարտը

Արձագանքո՞ւն է արդյոք մեկ օգտատիրոջ հոսքային չաթը այս ճշգրիտ կոնֆիգուրացիայի վրա առօրյա մարդկային խնդիրների համար — հաղորդագրություններ, նամակներ, երեխային բացատրություններ, պլաններ։

Վճիռը՝ PARTIAL։ Կոնֆիգուրացիան մաքուր անցնում է աշխատանքի մի ռեժիմում, կառուցվածքորեն ձախողվում է մյուսում, և որակի մեկ գեյթ ամբողջությամբ չի անցնում ոչ մի ռեժիմում։ Մանրամասները հենց պրոդուկտն են. ահա դրանք։

Ինչն է անցնում

Chat template-ի միջոցով անջատված մտածողության բլոկով պատասխանի առաջին թոքենը գալիս է 210մվunit_replicated մեդիանով — պատասխանը սկսվում է հոսքի հետ միասին, իսկ պատասխանով ավարտված հարցումների բաժինը երկու յունիթի վրա վեց կրկնական անցումներում՝ 100.0հարցումների %unit_replicated՝ լեզվի և կրկնությունների գեյթերն անցած վիճակում։

Ինչն է ձախողվում

Միացված մտածողությամբ, 1024 թոքեն բյուջեի դեպքում, կենցաղային հարցումների 58.3հարցումների %unit_replicated վերադարձրել է HTTP 200՝ դատարկ պատասխանով. մտածողության անցումը կերել է ամբողջ բյուջեն մինչև պատասխանի սկիզբը։ Ստատուսի կոդերը ստուգող հավելվածը դրանք գրանցում է որպես հաջողություն։

Բյուջեն մինչև 4096 թոքեն բարձրացնելը վերացնում է դատարկ պատասխանները, բայց պատասխանի առաջին թոքենն այդ դեպքում գալիս է 20191մվunit_replicated մեդիանով — տասնյակ վայրկյանների տեսանելի «մտածողություն»՝ նախքան «հարևանուհուն գրիր երկու նախադասությունից բաղկացած հաղորդագրություն» տիպի հարցման պատասխանը։

Ընդ որում կոնվենցիոն time-to-first-token-ը հավասար է 212մվunit_replicated բոլոր երեք ռեժիմներում — այն չի տարբերում աշխատող կոնֆիգուրացիան կոտրվածից։ Ամբողջական վերլուծությունը՝ Time-to-first-token-ը չի նկարագրում thinking-մոդելը հաշվետվության մեջ։

Ինչը ոչ մի տեղ չի անցնում

Հարցումի բառաքանակի բյուջեն. երկու ռեժիմներում էլ, որտեղ պատասխաններն ընդհանրապես հասնում են — առանց մտածողության և 4096 բյուջեով — պատասխանների նկատելի մասը գերազանցում էր այն երկարությունը, որը խնդրում էր փրոմփթը։ (1024 բյուջեի դեպքում ֆորմատի ձախողումները հենց դատարկ պատասխաններն են։) Այս բազմախոսությունը մոդելի հատկությունն է այս կորպուսի վրա, և հենց դրա պատճառով քարտը չի ստացել PASS WITH LIMITS։

Ռեպլիկացված է երկրորդ յունիթի վրա

Բոլոր երեք մեկ օգտատիրոջ բջիջները կրկին անցկացվել են երկրորդ՝ կոմերցիոն առումով նույնական GTR9 Pro-ի վրա՝ բիթ-առ-բիթ նույն մոդելի արտեֆակտով. պատկերը վերարտադրվել է (ակնթարթային պատասխաններ առանց մտածողության, դատարկների մեծամասնություն 1024 բյուջեի դեպքում, տասնյակ վայրկյաններ 4096-ի դեպքում), և վերևի մեկ օգտատիրոջ թվերը դուրս են բերվել երկու յունիթներով։ Դետալ, որն ավելացրել է ռեպլիկացիան. երկրորդ յունիթի վրա 48 հարցումից մեկը սպառել է նույնիսկ 4096 թոքենի բյուջեն — ավելի մեծ բյուջեն նվազեցնում է դատարկ պատասխանի ռիսկը, բայց չի վերացնում այն։

Զուգահեռ բեռնվածության տակ (closed loop)

Անջատված մտածողությամբ և 4 միաժամանակյա հոսքով պատասխանի առաջին թոքենի մեդիանը տեղաշարժվում է մինչև 338մվrepeated. 8 հոսքով՝ մինչև 865մվrepeated — ավարտման բաժինը՝ համապատասխանաբար 100.0հարցումների %repeated և 100.0հարցումների %repeated։ Սա closed-loop չափում է (յուրաքանչյուր վիրտուալ օգտատեր սպասում է իր պատասխանին, նախքան նորից հարցնելը) — այն ցույց է տալիս, թե ինչ է զգում N միաժամանակյա օգտատերերից յուրաքանչյուրը, և սա ոչ թողունակության կամ SLO-ի մասին հայտարարություն է։

Շահագործման տիրույթն ըստ տվյալների

Այս կոնֆիգուրացիայի վրա կենցաղային օգնականի դերի համար. անջատեք մտածողության բլոկը — կամ նախատեսեք առնվազն 4096 թոքեն բյուջե և ընդունեք սպասումը։ Մի՛ գործարկեք «մտածողությունը միացված + 1024 թոքեն» լռելյայն համադրությունը. մոնիթորինգում դատարկ պատասխանները հաշվեք որպես սխալներ։

Ինչը կփոխի վճիռը

Առանց մտածողության ռեժիմում պատասխանների որակի գնահատումը (այստեղ չի ստուգվել — հավանաբար ավելի վատ է), 8-ից բարձր concurrency-ն և runtime-ի կամ մոդելի արտեֆակտի թարմացումը — սրանցից ցանկացածը գործարկում է ռեվալիդացիա։ Հում ապացույցների փաթեթները և harness-ը բաց են. agmind-bench, մեթոդաբանությունը՝ ապացույցների և տվյալների էջում։

← Ստուգված կոնֆիգուրացիաներ