# Մուլտիսլոտ LLM-ինֆերենս Strix Halo-ի վրա — legacy արդյունքներ

> Ինչ է անում մեկ Strix Halo մինի-համակարգիչը 128 ԳԲ-ով 32 զուգահեռ չաթ-հոսքի տակ. բաղադրատոմսեր, կոնկուրենտության կտրուկ անկում 8 հարցումից հետո բոլոր կոնֆիգուրացիաներում, և որտեղ սպեկուլյատիվ դեկոդավորումն այլևս չի օգնում։

- Published: 2026-07-31
- Evidence level: legacy
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/strix-halo-multislot-legacy/

> **Ապացույցների մակարդակ՝ `legacy`։** Այս չափումները կատարվել են v1
> մեթոդաբանությունից առաջ՝ լաբորատորիայի սեփական ստենդի վրա, ամրագրված (pinned)
> image digest-ներով, salted չքեշավորվող prompt-ներով և հիմնականում երեք վազքի
> մեդիաններով — բայց առանց նախագրանցման, առանց երկրորդ յունիթի վրա
> ռեպլիկացիայի և ավելի հին սոֆթի վրա (միջուկ 6.17՝ ներկայիս հավասարեցված
> 7.0-ի դիմաց)։ Ստորև բերված թվերը մեջբերումներ են հանրային ռեպոզիտորիից,
> ոչ թե արժեքներ լաբորատորիայի claim registry-ից։ Ֆլագմանային հետազոտությունը
> վերաչափելու է այս տիրույթը v1 մեթոդաբանությամբ։

**Աղբյուր (բաղադրատոմսեր, harness-ներ, վազքերի հում տվյալներ)՝**
[github.com/botAGI/strix-halo-multislot](https://github.com/botAGI/strix-halo-multislot) (MIT)
· Մանրամասն պատմությունը՝ [հոդված Habr-ում](https://habr.com/ru/articles/1060520/)

## Ինչ էր թեստավորվում

Մեկ Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S gfx1151, 128 ԳԲ unified
LPDDR5X), բազմաօգտատեր չաթ llama.cpp `server-vulkan`-ի վրա՝ ամրագրված (pinned)
image digest-ով։ Բեռնվածությունը՝ ցանցով, հարևան նոդից; մետրիկաները՝ սերվերային
`timings`-ից; ագրեգատը = Σ predicted-թոքեններ / makespan։ Ռեպոյում հրապարակված
են գործարկման սկրիպտները, harness-ները և լրիվ աղյուսակները՝ ներառյալ
ձախողումները և երեք սեփական վաղ եզրակացություն, որոնք հերքվել են ավելի
ճշգրիտ չափումներով։

## Հիմնական պատմական արդյունքները (մեջբերումներ ռեպոյից)

| Սցենար | Կոնֆիգուրացիա | Արդյունքը ռեպոյից |
|---|---|---|
| Բազմաօգտատեր չաթ, սքրինինգ | Gemma 4 26B A4B, 32 կլիենտ | 236 tok/s գումարային, ~7 tok/s մեկ հարցումին  |
| Endurance, 30 րոպե | նույնը | 226 tok/s միջինում, 78°C, առանց թրոթլինգի  |
| Բազմաօգտատեր Qwen | Qwen3.6-35B-A3B Q4_0, 32 կլիենտ | 178 tok/s գումարային (3-ի մեդիան)  |
| Մեկ հոսք + MTP-դրաֆտ | Qwen3.6 UD-Q4_K_M | ~90 tok/s մեկ հոսքին (3-ի մեդիան)  |

## Գտածոներ, որոնք արժե իմանալ (այս ստենդի սահմաններում)

1. **Արտադրողականության կտրուկ անկումը 8 զուգահեռ հարցումից անմիջապես հետո
   դրսևորվեց բոլոր չորս կոնֆիգուրացիաներում**՝ երկու ճարտարապետություններում
   և բոլոր երեք քվանտներում։ Մոդելն էր որոշում անկման խորությունը և
   վերականգնման ձևը։ Արմատական պատճառը հաստատված չէ (kernel-պրոֆիլավորում
   չի եղել); մեկ մոդելի համար չափված գործնական բուժումը (ակտիվ սլոտների
   սահմանափակումը) երկրորդ մոդելին կվնասեր։
2. **Սպեկուլյատիվ դեկոդավորումը (MTP) շահում էր մեկ հոսքում և պարտվում
   բեռի տակ** չափված կետերում — կրոսօվեր, որը վենդորական նյութերը՝ այլ
   ստեկերի վրա MTP-ի իրենց խոշոր շահույթներով, չէին կանխատեսի։
3. **Քվանտները փոխարինելի չեն կոնկուրենտության պայմաններում**, իսկ մեկ
   վազքից արված վաղ եզրակացությունը «լավագույն» քվանտի մասին հերքվեց
   կրկնություններով — հրապարակված է ռեպոյում որպես մերժված վարկած։
4. **Միջուկի չորս պարամետրից բաղկացած հավաքածուն տվեց գեներացիայի չափելի
   աճ** reboot-A/B-ում; առանձին պարամետրերի ներդրումը գիտակցաբար չի
   հայտարարվել։
5. **llama.cpp-ի `--parallel`-ը լռելյայն auto է (4 սլոտ թեստավորված
   build-երում)** — «մեկ օգտատիրոջ համար» գործարկված սերվերն արդեն
   մուլտիսլոտ է։ Դրոշակներով կոնֆիգների համեմատությունը քիչ էր մնում կեղծ
   գտածո ծներ; ճշմարտության աղբյուրը `/props → total_slots`-ն է։

## Ինչ այս տվյալները չեն հաստատում

Ո՛չ կլիենտական TTFT (միայն սերվերային `timings`, հերթը հաշվի առնված չէ),
ո՛չ կոնֆիգուրացիաների որակի գնահատում, ո՛չ ռեպլիկացիա երկրորդ յունիթի վրա,
ո՛չ ընդհանրացում այս արկղից, digest-ից և միջուկից դուրս։ Ֆլագմանային
հետազոտությունը (տե՛ս նախագրանցումը հրապարակումից հետո) փակում է հենց
այս բացերը։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
