# Beelink GTR9 Pro-ն լոկալ LLM-ների համար. ինչ չափեցին երկու միավորները սպասարկման մեկ ամսում

> Գրախոսություններն այս տուփը բենչմարքում են մեկ շաբաթ։ Մենք գնեցինք երկուսը, սառեցրինք workload-ները և այդ պահից դրանցից սպասարկում ենք. աշխատող սոֆթ-ստեկը, չափված թվերը, որտեղ երկու միավորները համընկան, և այն, ինչի համար դեռևս չենք երաշխավորում։

- Published: 2026-08-21
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/beelink-gtr9-pro-local-llm/

Երկու կոմերցիոն առումով նույնական Beelink GTR9 Pro միավոր — Ryzen AI
Max+ 395, 128 ԳԲ LPDDR5X-8000 unified հիշողություն, Radeon 8060S
(gfx1151), երկու 10GbE պորտ — այն մեքենաներն են, որոնց վրա ստացվել է մեր
claim-երի ռեեստրի թվերի մեծ մասը։ Այս էջն այն մասին է, թե ինչ սովորեցրեց
դրանցով իրական սպասարկման մեկ ամիսը. որ սոֆթ-ստեկն է աշխատում, ինչ է
տուփը չափելիորեն անում, որտեղ երկու միավորները համընկան, և ինչի համար
մենք դեռևս չենք երաշխավորում։

## Ինչու երկու նույնական տուփ

Որովհետև մեկ տուփով չես իմանա՝ թիվը սարքաշարի՞ հատկություն է, թե՞ քո
կոնկրետ օրինակի։ Երկրորդի գնումով է, որ չափումը դադարում է անեկդոտ
լինելուց. նույն սառեցված workload-ը, նույն ամրագրված runtime-ը և մոդելի
նույն արտեֆակտը՝ քշված երկուսի վրա։ Մեր ռեեստրում `lab_unit_replicated`
մակարդակը կրող claim-երն այն են, որտեղ պատկերը երևաց երկու մեքենայի
վրա — հենց դա է այդ մակարդակի իմաստը, և հենց դա է գլխավոր պատճառը, որ
ունենք կրկնօրինակ, ոչ թե երկրորդ, ուրիշ տուփ։

## Սոֆթ-ստեկը, որ աշխատում է

Կոնֆիգուրացիան, որով այսօր աշխատում է մեր սերվինգ հանգույցը, կարդացված
է մեքենայից, ոչ թե վիքիից.

```
kernel   7.0.0-28-generic
Vulkan   RADV (GFX1151), Mesa 25.2.8
runtime  llama.cpp server, pinned by image digest
```

Սպասարկում ենք Vulkan ուղով՝ RADV-ի միջոցով։ ROCm-ը նույնպես աշխատում է
այս սարքաշարի վրա, և երկու backend-ներն էլ անցան կոռեկտության բոլոր
gate-երը, որ դրանց առաջ դրեցինք — տարբերությունը դուրս եկավ դեկոդի
տեմպում, ոչ թե որակում, և
[կողք կողքի դրվածքն առանձին համեմատության էջ է](https://agmind.ai/hy/compare/llamacpp-vulkan-vs-rocm-strix-halo/)։
Ցանցի կողմում երկու 10GbE ինտերֆեյսներն էլ ամբողջ ընթացքում միացված են
եղել; տուփի Wi-Fi-ը մերոնց վրա անջատված է, որովհետև սերվինգ հանգույցը
ռադիոկապ պահելու գործ չունի։

Կոնֆիգուրացիայի միակ կետը, որն արժե կարդալ գնումից առաջ. հիշողության
հատկացումը Linux-ի վրա աշխատում է ոչ այնպես, ինչպես հուշում է BIOS-ի
մենյուն, և մեծ մոդելների բեռնվել-չբեռնվելը որոշում է
[միջուկի պարամետրը](https://agmind.ai/hy/reports/strix-halo-memory-allocation/), ոչ թե
firmware-ի սահիկը։ Այդ էջը գոյություն ունի, որովհետև սկզբում դա մեզ
ժամանակ արժեցավ։

## Ինչ է անում տուփը

35B դասի MoE մոդել Q4_K_M-ով, առօրյա հարցումներ, reasoning-ն անջատված.
պատասխանի առաջին թոքենը՝
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/))-ում,
դեկոդը՝ **15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ով։
Չորս միաժամանակյա չաթի տակ առաջին բառի սպասումը դառնում է
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)), ութի
դեպքում՝ **865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)),
ընդ որում ավարտվածությունը պահվում է
**100.0 % of requests** ([strix.qwen36.interactive2.c8.completion-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.completion-nothink/))-ի
վրա։

Կառուցվածքային ավտոմատացում. խիստ JSON առաջադրանքներն ավարտվեցին
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/))-ով։
Որոնումը երկար կոնտեքստում մինչև 32k թոքենանոց փաստաթղթերի վրա՝
**100.0 % of requests** ([strix.qwen36.longctx.c1.needle-success](https://agmind.ai/claims/strix.qwen36.longctx.c1.needle-success/)), իսկ
prefill-ի հաշիվն այդ չափի փաստաթղթի համար՝
**33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)) — հենց այն
թիվը, որի շուրջ պետք է պլանավորեն փաստաթղթային հոսքերը։

Չափված ամբողջական աղյուսակներն ապրում են
[բենչմարքների պահոցում](https://github.com/botAGI/strix-halo-llm-benchmarks),
իսկ ամեն թիվ ունի մշտական էջ [ռեեստրում](https://agmind.ai/hy/claims/)։

## Դիմանո՞ւմ է որպես սերվինգ տուփ

Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպը շարժվեց
**1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/))-ով՝
**30.0 ms/token** ([strix.qwen36.endurance.c4.itl-median](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-median/)) մեդիանով —
երկու միավորի վրա էլ, նույն ձևով։
[Շարունակական բեռի հաշվետվությունը](https://agmind.ai/hy/reports/strix-halo-sustained-load-3-hours/)
«այս բանը կխեղդվի՞, եթե իրոք օգտագործեմ» հարցի պատասխանի երկար
տարբերակն է։

Սառեցված թեստերից դուրս կա ավելի փափուկ վկայություն. միավորներից մեկը
գրելու պահին մեկ շաբաթից ավելի է, ինչ անընդմեջ խառը ծառայության մեջ է՝
սպասարկում է մոդելներ, մինչ մենք այլ բաներով ենք զբաղված։ Uptime-ը
բենչմարք չէ, և մենք այն որպես բենչմարք չենք ներկայացնում — բայց տուփը,
որին դայակ է պետք, հանգիստ շաբաթներ չի կուտակում։

## Ինչի համար չենք երաշխավորում

**Երկու միավորը խմբաքանակ չէ։** Վերևի ամեն ինչ նկարագրում է մեր երկու
մեքենան։ Արտադրական ցրվածքը, ռեվիզիաներն ու firmware-ի
տարբերությունները ամբողջ թողարկման մասշտաբով հենց այն են, ինչ երկու
նմուշով չես չափի, և մեր [ստենդների էջը](https://agmind.ai/hy/testbed/) այս սահմանն
ուղիղ տեքստով է արձանագրում։

**Որպես դեսքթոփ չենք փորձարկել։** Ո՛չ մոնիտորի ելք, ո՛չ խաղեր, ո՛չ
ջերմային վարք GPU-ի գրաֆիկական բեռի տակ. սրանք սերվինգ հանգույցներ են,
և չափել ենք սպասարկումը։

**Ոչ մի համեմատություն տուփերի հետ, որոնք չունենք։** Նույն սիլիցիումը
դնում են նաև այլ վենդորներ, իսկ դրանք իրար հետ համեմատող ցուցակները
հեշտ է գրել և անհնար ստուգել։ Այս մեկը չափեցինք, որովհետև այն ունենք։

**Գնային խորհուրդ չկա։** Սարքաշարի գները շարժվում են; լաբորատորիան
դրանք չի հրապարակում։

## Եթե արդեն ունես մեկը

Ինքդ քշիր սառեցված workload-ները —
[harness-ը հրապարակային է](https://github.com/botAGI/agmind-bench), իսկ
[վերարտադրման պայմանագիրը](https://agmind.ai/hy/reproduce/) նշանակում է, որ հաստատված
անկախ գործարկումը բարձրացնում է claim-ի ապացուցողական մակարդակը, իսկ
ձախողվածը նույնպես հրապարակվում է։ Երկրորդ, երրորդ ու չորրորդ GTR9
Pro-ն ուրիշների ձեռքում այն է, ինչով «երկու միավորները համընկան»-ը
դառնում է ավելի ամուր բան, քան երկու միավորի համաձայնությունը։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
