Երկու կոմերցիոն առումով նույնական Beelink GTR9 Pro միավոր — Ryzen AI Max+ 395, 128 ԳԲ LPDDR5X-8000 unified հիշողություն, Radeon 8060S (gfx1151), երկու 10GbE պորտ — այն մեքենաներն են, որոնց վրա ստացվել է մեր claim-երի ռեեստրի թվերի մեծ մասը։ Այս էջն այն մասին է, թե ինչ սովորեցրեց դրանցով իրական սպասարկման մեկ ամիսը. որ սոֆթ-ստեկն է աշխատում, ինչ է տուփը չափելիորեն անում, որտեղ երկու միավորները համընկան, և ինչի համար մենք դեռևս չենք երաշխավորում։
Ինչու երկու նույնական տուփ
Որովհետև մեկ տուփով չես իմանա՝ թիվը սարքաշարի՞ հատկություն է, թե՞ քո
կոնկրետ օրինակի։ Երկրորդի գնումով է, որ չափումը դադարում է անեկդոտ
լինելուց. նույն սառեցված workload-ը, նույն ամրագրված runtime-ը և մոդելի
նույն արտեֆակտը՝ քշված երկուսի վրա։ Մեր ռեեստրում lab_unit_replicated
մակարդակը կրող claim-երն այն են, որտեղ պատկերը երևաց երկու մեքենայի
վրա — հենց դա է այդ մակարդակի իմաստը, և հենց դա է գլխավոր պատճառը, որ
ունենք կրկնօրինակ, ոչ թե երկրորդ, ուրիշ տուփ։
Սոֆթ-ստեկը, որ աշխատում է
Կոնֆիգուրացիան, որով այսօր աշխատում է մեր սերվինգ հանգույցը, կարդացված է մեքենայից, ոչ թե վիքիից.
kernel 7.0.0-28-generic
Vulkan RADV (GFX1151), Mesa 25.2.8
runtime llama.cpp server, pinned by image digest
Սպասարկում ենք Vulkan ուղով՝ RADV-ի միջոցով։ ROCm-ը նույնպես աշխատում է այս սարքաշարի վրա, և երկու backend-ներն էլ անցան կոռեկտության բոլոր gate-երը, որ դրանց առաջ դրեցինք — տարբերությունը դուրս եկավ դեկոդի տեմպում, ոչ թե որակում, և կողք կողքի դրվածքն առանձին համեմատության էջ է։ Ցանցի կողմում երկու 10GbE ինտերֆեյսներն էլ ամբողջ ընթացքում միացված են եղել; տուփի Wi-Fi-ը մերոնց վրա անջատված է, որովհետև սերվինգ հանգույցը ռադիոկապ պահելու գործ չունի։
Կոնֆիգուրացիայի միակ կետը, որն արժե կարդալ գնումից առաջ. հիշողության հատկացումը Linux-ի վրա աշխատում է ոչ այնպես, ինչպես հուշում է BIOS-ի մենյուն, և մեծ մոդելների բեռնվել-չբեռնվելը որոշում է միջուկի պարամետրը, ոչ թե firmware-ի սահիկը։ Այդ էջը գոյություն ունի, որովհետև սկզբում դա մեզ ժամանակ արժեցավ։
Ինչ է անում տուփը
35B դասի MoE մոդել Q4_K_M-ով, առօրյա հարցումներ, reasoning-ն անջատված. պատասխանի առաջին թոքենը՝ 210մվunit_replicated-ում, դեկոդը՝ 15.9մվ/թոքենrepeated-ով։ Չորս միաժամանակյա չաթի տակ առաջին բառի սպասումը դառնում է 338մվrepeated, ութի դեպքում՝ 865մվrepeated, ընդ որում ավարտվածությունը պահվում է 100.0հարցումների %repeated-ի վրա։
Կառուցվածքային ավտոմատացում. խիստ JSON առաջադրանքներն ավարտվեցին 100.0հարցումների %repeated-ով։ Որոնումը երկար կոնտեքստում մինչև 32k թոքենանոց փաստաթղթերի վրա՝ 100.0հարցումների %repeated, իսկ prefill-ի հաշիվն այդ չափի փաստաթղթի համար՝ 33965մվrepeated — հենց այն թիվը, որի շուրջ պետք է պլանավորեն փաստաթղթային հոսքերը։
Չափված ամբողջական աղյուսակներն ապրում են բենչմարքների պահոցում, իսկ ամեն թիվ ունի մշտական էջ ռեեստրում։
Դիմանո՞ւմ է որպես սերվինգ տուփ
Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպը շարժվեց 1.6%single_run-ով՝ 30.0մվ/թոքենsingle_run մեդիանով — երկու միավորի վրա էլ, նույն ձևով։ Շարունակական բեռի հաշվետվությունը «այս բանը կխեղդվի՞, եթե իրոք օգտագործեմ» հարցի պատասխանի երկար տարբերակն է։
Սառեցված թեստերից դուրս կա ավելի փափուկ վկայություն. միավորներից մեկը գրելու պահին մեկ շաբաթից ավելի է, ինչ անընդմեջ խառը ծառայության մեջ է՝ սպասարկում է մոդելներ, մինչ մենք այլ բաներով ենք զբաղված։ Uptime-ը բենչմարք չէ, և մենք այն որպես բենչմարք չենք ներկայացնում — բայց տուփը, որին դայակ է պետք, հանգիստ շաբաթներ չի կուտակում։
Ինչի համար չենք երաշխավորում
Երկու միավորը խմբաքանակ չէ։ Վերևի ամեն ինչ նկարագրում է մեր երկու մեքենան։ Արտադրական ցրվածքը, ռեվիզիաներն ու firmware-ի տարբերությունները ամբողջ թողարկման մասշտաբով հենց այն են, ինչ երկու նմուշով չես չափի, և մեր ստենդների էջը այս սահմանն ուղիղ տեքստով է արձանագրում։
Որպես դեսքթոփ չենք փորձարկել։ Ո՛չ մոնիտորի ելք, ո՛չ խաղեր, ո՛չ ջերմային վարք GPU-ի գրաֆիկական բեռի տակ. սրանք սերվինգ հանգույցներ են, և չափել ենք սպասարկումը։
Ոչ մի համեմատություն տուփերի հետ, որոնք չունենք։ Նույն սիլիցիումը դնում են նաև այլ վենդորներ, իսկ դրանք իրար հետ համեմատող ցուցակները հեշտ է գրել և անհնար ստուգել։ Այս մեկը չափեցինք, որովհետև այն ունենք։
Գնային խորհուրդ չկա։ Սարքաշարի գները շարժվում են; լաբորատորիան դրանք չի հրապարակում։
Եթե արդեն ունես մեկը
Ինքդ քշիր սառեցված workload-ները — harness-ը հրապարակային է, իսկ վերարտադրման պայմանագիրը նշանակում է, որ հաստատված անկախ գործարկումը բարձրացնում է claim-ի ապացուցողական մակարդակը, իսկ ձախողվածը նույնպես հրապարակվում է։ Երկրորդ, երրորդ ու չորրորդ GTR9 Pro-ն ուրիշների ձեռքում այն է, ինչով «երկու միավորները համընկան»-ը դառնում է ավելի ամուր բան, քան երկու միավորի համաձայնությունը։