Հաշվետվություն

Մուլտիսլոտ LLM-ինֆերենս Strix Halo-ի վրա — legacy արդյունքներ

Ինչ է անում մեկ Strix Halo մինի-համակարգիչը 128 ԳԲ-ով 32 զուգահեռ չաթ-հոսքի տակ. բաղադրատոմսեր, կոնկուրենտության կտրուկ անկում 8 հարցումից հետո բոլոր կոնֆիգուրացիաներում, և որտեղ սպեկուլյատիվ դեկոդավորումն այլևս չի օգնում։

legacy internal research 31 հուլիսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Ապացույցների մակարդակ՝ legacy։ Այս չափումները կատարվել են v1 մեթոդաբանությունից առաջ՝ լաբորատորիայի սեփական ստենդի վրա, ամրագրված (pinned) image digest-ներով, salted չքեշավորվող prompt-ներով և հիմնականում երեք վազքի մեդիաններով — բայց առանց նախագրանցման, առանց երկրորդ յունիթի վրա ռեպլիկացիայի և ավելի հին սոֆթի վրա (միջուկ 6.17՝ ներկայիս հավասարեցված 7.0-ի դիմաց)։ Ստորև բերված թվերը մեջբերումներ են հանրային ռեպոզիտորիից, ոչ թե արժեքներ լաբորատորիայի claim registry-ից։ Ֆլագմանային հետազոտությունը վերաչափելու է այս տիրույթը v1 մեթոդաբանությամբ։

Աղբյուր (բաղադրատոմսեր, harness-ներ, վազքերի հում տվյալներ)՝ github.com/botAGI/strix-halo-multislot (MIT) · Մանրամասն պատմությունը՝ հոդված Habr-ում

Ինչ էր թեստավորվում

Մեկ Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S gfx1151, 128 ԳԲ unified LPDDR5X), բազմաօգտատեր չաթ llama.cpp server-vulkan-ի վրա՝ ամրագրված (pinned) image digest-ով։ Բեռնվածությունը՝ ցանցով, հարևան նոդից; մետրիկաները՝ սերվերային timings-ից; ագրեգատը = Σ predicted-թոքեններ / makespan։ Ռեպոյում հրապարակված են գործարկման սկրիպտները, harness-ները և լրիվ աղյուսակները՝ ներառյալ ձախողումները և երեք սեփական վաղ եզրակացություն, որոնք հերքվել են ավելի ճշգրիտ չափումներով։

Հիմնական պատմական արդյունքները (մեջբերումներ ռեպոյից)

ՍցենարԿոնֆիգուրացիաԱրդյունքը ռեպոյից
Բազմաօգտատեր չաթ, սքրինինգGemma 4 26B A4B, 32 կլիենտ236 tok/s գումարային, ~7 tok/s մեկ հարցումին
Endurance, 30 րոպենույնը226 tok/s միջինում, 78°C, առանց թրոթլինգի
Բազմաօգտատեր QwenQwen3.6-35B-A3B Q4_0, 32 կլիենտ178 tok/s գումարային (3-ի մեդիան)
Մեկ հոսք + MTP-դրաֆտQwen3.6 UD-Q4_K_M~90 tok/s մեկ հոսքին (3-ի մեդիան)

Գտածոներ, որոնք արժե իմանալ (այս ստենդի սահմաններում)

  1. Արտադրողականության կտրուկ անկումը 8 զուգահեռ հարցումից անմիջապես հետո դրսևորվեց բոլոր չորս կոնֆիգուրացիաներում՝ երկու ճարտարապետություններում և բոլոր երեք քվանտներում։ Մոդելն էր որոշում անկման խորությունը և վերականգնման ձևը։ Արմատական պատճառը հաստատված չէ (kernel-պրոֆիլավորում չի եղել); մեկ մոդելի համար չափված գործնական բուժումը (ակտիվ սլոտների սահմանափակումը) երկրորդ մոդելին կվնասեր։
  2. Սպեկուլյատիվ դեկոդավորումը (MTP) շահում էր մեկ հոսքում և պարտվում բեռի տակ չափված կետերում — կրոսօվեր, որը վենդորական նյութերը՝ այլ ստեկերի վրա MTP-ի իրենց խոշոր շահույթներով, չէին կանխատեսի։
  3. Քվանտները փոխարինելի չեն կոնկուրենտության պայմաններում, իսկ մեկ վազքից արված վաղ եզրակացությունը «լավագույն» քվանտի մասին հերքվեց կրկնություններով — հրապարակված է ռեպոյում որպես մերժված վարկած։
  4. Միջուկի չորս պարամետրից բաղկացած հավաքածուն տվեց գեներացիայի չափելի աճ reboot-A/B-ում; առանձին պարամետրերի ներդրումը գիտակցաբար չի հայտարարվել։
  5. llama.cpp-ի --parallel-ը լռելյայն auto է (4 սլոտ թեստավորված build-երում) — «մեկ օգտատիրոջ համար» գործարկված սերվերն արդեն մուլտիսլոտ է։ Դրոշակներով կոնֆիգների համեմատությունը քիչ էր մնում կեղծ գտածո ծներ; ճշմարտության աղբյուրը /props → total_slots-ն է։

Ինչ այս տվյալները չեն հաստատում

Ո՛չ կլիենտական TTFT (միայն սերվերային timings, հերթը հաշվի առնված չէ), ո՛չ կոնֆիգուրացիաների որակի գնահատում, ո՛չ ռեպլիկացիա երկրորդ յունիթի վրա, ո՛չ ընդհանրացում այս արկղից, digest-ից և միջուկից դուրս։ Ֆլագմանային հետազոտությունը (տե՛ս նախագրանցումը հրապարակումից հետո) փակում է հենց այս բացերը։

Ինչպես մեջբերել

AGmind Systems Lab (2026-07-31). Մուլտիսլոտ LLM-ինֆերենս Strix Halo-ի վրա — legacy արդյունքներ. Evidence level: legacy. https://agmind.ai/hy/reports/strix-halo-multislot-legacy/
← Հաշվետվություններ