Ապացույցների մակարդակ՝
legacy։ Այս չափումները կատարվել են v1 մեթոդաբանությունից առաջ՝ լաբորատորիայի սեփական ստենդի վրա, ամրագրված (pinned) image digest-ներով, salted չքեշավորվող prompt-ներով և հիմնականում երեք վազքի մեդիաններով — բայց առանց նախագրանցման, առանց երկրորդ յունիթի վրա ռեպլիկացիայի և ավելի հին սոֆթի վրա (միջուկ 6.17՝ ներկայիս հավասարեցված 7.0-ի դիմաց)։ Ստորև բերված թվերը մեջբերումներ են հանրային ռեպոզիտորիից, ոչ թե արժեքներ լաբորատորիայի claim registry-ից։ Ֆլագմանային հետազոտությունը վերաչափելու է այս տիրույթը v1 մեթոդաբանությամբ։
Աղբյուր (բաղադրատոմսեր, harness-ներ, վազքերի հում տվյալներ)՝ github.com/botAGI/strix-halo-multislot (MIT) · Մանրամասն պատմությունը՝ հոդված Habr-ում
Ինչ էր թեստավորվում
Մեկ Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S gfx1151, 128 ԳԲ unified
LPDDR5X), բազմաօգտատեր չաթ llama.cpp server-vulkan-ի վրա՝ ամրագրված (pinned)
image digest-ով։ Բեռնվածությունը՝ ցանցով, հարևան նոդից; մետրիկաները՝ սերվերային
timings-ից; ագրեգատը = Σ predicted-թոքեններ / makespan։ Ռեպոյում հրապարակված
են գործարկման սկրիպտները, harness-ները և լրիվ աղյուսակները՝ ներառյալ
ձախողումները և երեք սեփական վաղ եզրակացություն, որոնք հերքվել են ավելի
ճշգրիտ չափումներով։
Հիմնական պատմական արդյունքները (մեջբերումներ ռեպոյից)
| Սցենար | Կոնֆիգուրացիա | Արդյունքը ռեպոյից |
|---|---|---|
| Բազմաօգտատեր չաթ, սքրինինգ | Gemma 4 26B A4B, 32 կլիենտ | 236 tok/s գումարային, ~7 tok/s մեկ հարցումին |
| Endurance, 30 րոպե | նույնը | 226 tok/s միջինում, 78°C, առանց թրոթլինգի |
| Բազմաօգտատեր Qwen | Qwen3.6-35B-A3B Q4_0, 32 կլիենտ | 178 tok/s գումարային (3-ի մեդիան) |
| Մեկ հոսք + MTP-դրաֆտ | Qwen3.6 UD-Q4_K_M | ~90 tok/s մեկ հոսքին (3-ի մեդիան) |
Գտածոներ, որոնք արժե իմանալ (այս ստենդի սահմաններում)
- Արտադրողականության կտրուկ անկումը 8 զուգահեռ հարցումից անմիջապես հետո դրսևորվեց բոլոր չորս կոնֆիգուրացիաներում՝ երկու ճարտարապետություններում և բոլոր երեք քվանտներում։ Մոդելն էր որոշում անկման խորությունը և վերականգնման ձևը։ Արմատական պատճառը հաստատված չէ (kernel-պրոֆիլավորում չի եղել); մեկ մոդելի համար չափված գործնական բուժումը (ակտիվ սլոտների սահմանափակումը) երկրորդ մոդելին կվնասեր։
- Սպեկուլյատիվ դեկոդավորումը (MTP) շահում էր մեկ հոսքում և պարտվում բեռի տակ չափված կետերում — կրոսօվեր, որը վենդորական նյութերը՝ այլ ստեկերի վրա MTP-ի իրենց խոշոր շահույթներով, չէին կանխատեսի։
- Քվանտները փոխարինելի չեն կոնկուրենտության պայմաններում, իսկ մեկ վազքից արված վաղ եզրակացությունը «լավագույն» քվանտի մասին հերքվեց կրկնություններով — հրապարակված է ռեպոյում որպես մերժված վարկած։
- Միջուկի չորս պարամետրից բաղկացած հավաքածուն տվեց գեներացիայի չափելի աճ reboot-A/B-ում; առանձին պարամետրերի ներդրումը գիտակցաբար չի հայտարարվել։
- llama.cpp-ի
--parallel-ը լռելյայն auto է (4 սլոտ թեստավորված build-երում) — «մեկ օգտատիրոջ համար» գործարկված սերվերն արդեն մուլտիսլոտ է։ Դրոշակներով կոնֆիգների համեմատությունը քիչ էր մնում կեղծ գտածո ծներ; ճշմարտության աղբյուրը/props → total_slots-ն է։
Ինչ այս տվյալները չեն հաստատում
Ո՛չ կլիենտական TTFT (միայն սերվերային timings, հերթը հաշվի առնված չէ),
ո՛չ կոնֆիգուրացիաների որակի գնահատում, ո՛չ ռեպլիկացիա երկրորդ յունիթի վրա,
ո՛չ ընդհանրացում այս արկղից, digest-ից և միջուկից դուրս։ Ֆլագմանային
հետազոտությունը (տե՛ս նախագրանցումը հրապարակումից հետո) փակում է հենց
այս բացերը։