Հաշվետվություն

Ի՞նչ սարքաշար լոկալ LLM-ի համար. չափված պատասխան՝ ըստ workload-ի

Լոկալ AI-ի սարքաշարային ուղեցույցների գրեթե ամբողջը սպեկ-թերթիկ է, վենդորի ինքնագրախոսություն կամ VRAM-աստիճաններ վերարտադրող ցուցակ։ Այս էջը սկսում է workload-ից, բերում է միայն մեր տուփերի վրա չափված թվերը և բացահայտ անվանում այն ուղիները, որոնց մասին տվյալ չունենք։

lab_repeated internal research 21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Կարճ տարբերակը. նախ ընտրիր workload-ը, հետո՝ տուփը։ Մեկ հոգու օգնականը, թիմային չաթ-տուփը և միլիոն թոքենի հետազոտական ստենդը երեք տարբեր գնում են, և ամեն մեկը որոշող թիվը տարբեր է։ Ստորև այն է, ինչ մեր սարքաշարը չափելիորեն արեց ամեն workload-ի համար — և նույնքան կարևոր՝ այն workload-ները, որոնց մասին տվյալ չունենք և հրաժարվում ենք հորինել։

Ինչո՞ւ են լոկալ AI-ի սարքաշարային ուղեցույցներն այդքան վատ

Փնտրիր «լավագույն երկաթը լոկալ LLM-ի համար»-ի ցանկացած տարբերակ, և արդյունքները կունենան նույն կառուցվածքը. GPU-ների աղյուսակ ըստ VRAM-ի, հիշողության թվաբանության մեկ պարբերություն, առաջարկություն։ Փնտրիր այդ առաջարկության տակ դրված չափումը — սովորաբար չկա։ Վենդորները ռանկավորվում են իրենց իսկ ապրանքային կատեգորիաներով. մինի-համակարգիչների որոնման վերին արդյունքները հաճախ հենց մինի-համակարգիչ վաճառողներն են՝ գրախոսելով իրենք իրենց։ Գործընկերային ցուցակները մեջբերում են վայրկյանում թոքենների ցուցանիշներ, որոնք մի քանի քայլով հանգում են երկու-երեք սկզբնաղբյուրի՝ մերկացված այն մոդելից, քվանտից, կոնտեքստի երկարությունից և runtime-ից, որոնք դրանք ծնել են։ Հենց այդ մերկացումն է ամբողջ խնդիրը. բենչմարքային թիվը քողարկված կոնֆիգ է, իսկ առանց կոնֆիգի թիվը գնում որոշել չի կարող։

Այս էջն ավելի նեղ է և, կարծում ենք, ավելի օգտակար. ինչ իրապես արեցին մեր տիրապետած սարքաշարի երկու դասերը՝ սառեցված workload-ների տակ, ամեն թիվ հղված իր հում գործարկումներին։

Սկսիր workload-ից, ոչ թե տուփից

Չորս հարց որոշում է լոկալ AI-ի սարքաշարային գրեթե ամեն ընտրություն։ Պատասխանիր դրանց, նախքան մեկ սպեկ-թերթիկ բացելը։

Քանի՞ հոգի։ Մեկ մարդու օգնականը և հնգանոց թիմը տարբեր մեքենաներ են — ոչ թե հում արագության պատճառով, այլ որովհետև սպասումն այլ կերպ է աճում զուգահեռության տակ։

Որքա՞ն երկար են prompt-երը։ Չաթային workload-ը և «տեղադրիր 50 էջանոց փաստաթուղթը» workload-ը մեքենայի տարբեր մասերն են լարում։ Երկրորդում գերիշխում է prefill-ը, որն իրեն բոլորովին այլ կերպ է պահում, քան գեներացիան։

Որքա՞ն մեծ է մոդելն իրականում։ Ոչ թե պարամետրերի քանակը, այլ դասը։ 35B դասի mixture-of-experts մոդելը և 284B-անոցն ապրում են այնպիսի սահմանի երկու կողմերում, որը մեկ տուփի մեջ դրված ոչ մի ծավալի unified հիշողություն չի հատում։

Ամբողջ օ՞րը միացված է։ Տասը րոպե արագ տուփը և ութ ժամ իր տեմպը պահող տուփը տարբեր ապրանքներ են, և այդ տարբերությունը ոչ մի սպեկ-թերթիկում չի երևում։

Ինչ է անում 128 ԳԲ unified հիշողությամբ տուփը

Մեր աշխատանքային ձիու դասը. Ryzen AI Max+ 395 մեքենա 128 ԳԲ unified հիշողությամբ, llama.cpp-ն ամրագրված image-ի digest-ով, սպասարկում է 35B դասի MoE մոդել։ Այստեղի ամեն ինչ չափված է սառեցված workload-ների վրա՝ ձախողումները հայտարարի մեջ պահած։

Անհատական օգնական։ Առաջին պատասխան-թոքենը՝ 210մվunit_replicated-ում, դեկոդը՝ 15.9մվ/թոքենrepeated-ով — այն շեմից ցածր, որտեղ մարդը սկսում է սպասում գրանցել, և ընթերցանության տեմպից առաջ։ Առօրյա գործերով մեկ օգտվողի համար այս դասի տուփը դադարեց խցան լինելուց։

Փոքր թիմ։ Չորս միաժամանակյա չաթի դեպքում առաջին բառի մեդիան սպասումը 338մվrepeated է, ութի դեպքում՝ 865մվrepeated, ընդ որում ավարտվածությունը պահվում է 100.0հարցումների %repeated-ի վրա։ Ամբողջական սանդուղքը ազնվորեն չափսավորելու եղանակն է. ընտրիր այն սպասումը, որ քո օգտվողները հանդուրժում են, և կարդա այն հակառակ ուղղությամբ։

Երկար փաստաթղթեր։ 32k թոքենանոց փաստաթղթի վրա առաջին հարցն արժե 33965մվrepeated — դա prefill-ի հաշիվն է, և հենց այս թվին պետք է նայեն փաստաթղթային հոսքեր գնողները՝ դեկոդի արագության փոխարեն։ Մնա նույն սեսիայում, և prompt cache-ը հաջորդ հարցը վերադարձնում է 860մվrepeated-ում. մեխանիկան և այն մեկ պայմանը, որ դրան պետք է, այստեղ ավելի կարևոր են, քան սարքաշարը։

Ամբողջ օրը։ Երեք ժամ անընդհատ չորս զուգահեռությամբ դեկոդի տեմպը շարժվեց 1.6%single_run-ով՝ երկու առևտրորեն նույնական միավորի վրա։ Շարունակական բեռի հաշվետվությունը պատասխանում է «կխեղդվի՞ մինի-համակարգիչը, եթե թողնեմ սպասարկելու» հարցին։

Ավտոմատացում։ Խիստ JSON պահանջող առաջադրանքներն ավարտվեցին 100.0հարցումների %repeated-ով — և հուսալիության փոփոխականը պարզվեց, որ մոդելն է, ոչ թե կարգավորումները։

Ինչ է այս հիշողության դասն ընդհանրապես աշխատեցնում՝ առանձին էջ է, իսկ ամբողջական չափված աղյուսակներն ապրում են բենչմարքների պահոցում։

Ինչ է անում DGX Spark-ի զույգը

Մեր տիրապետած մյուս դասը. երկու GB10 միավոր՝ միացված 200G կապով, սպասարկում են 284B պարամետրանոց MoE vLLM-ի միջոցով։ Սա պատասխանում է որոշակի հարցի — բաց կշիռների ֆրոնտիր դասը սեփական տանիքի տակ քշել — և գալիս է օպերացիոն տնային աշխատանքով. միջուկի ընտրության դրոշ, որն ավտոմատ ռեժիմը բաց է թողնում, ստանդարտ GPU մոնիտորինգ, որը կիսով չափ է աշխատում, և կոնտեքստի կոր մինչև միլիոն թոքեն, որի առաջին լցնումն իրադարձություն է, որ պլանավորում ես, ոչ թե հարցում, որ պարզապես ուղարկում ես։ Չափված գնորդական պատասխանը, ներառյալ՝ ով չպիտի գնի, առանձին էջ է, իսկ Strix տուփի հետ երկսյունակ համեմատությունը՝ այստեղ։

Ո՞ր տուփը որ workload-ի համար

Մեր սեփական չափումները՝ կարդացված որպես որոշում.

Ինչ մենք ՉԵՆՔ չափել

Սա այն բաժինն է, որ մյուս բոլոր սարքաշարային ուղեցույցները բաց են թողնում, և հենց դրա համար է մերը կարճ այնտեղ, որտեղ նրանցը վստահ է։

Դիսկրետ GPU-ով build-եր։ Մեկ և երկու RTX դասի քարտ, օգտագործված 3090-ի հարցը, 5090-ի հարցը — դրանք գերիշխում են որոնման արդյունքներում, և մենք դրանց մասին առաջնային տվյալ չունենք։ Մեր ստենդը հայտարարում է CUDA ուղի, բայց այն հրապարակված գործարկումներ չունի, ուստի պնդում չենք անում։ Երբ գործարկվի, կհասնի հում գործարկումներով՝ ինչպես մնացած ամեն ինչ։

Apple Silicon։ Հայտարարված ուղի, զրո հրապարակված գործարկում, զրո պնդում։

Միայն CPU և փոքր VRAM-ով offload։ «Մոդելը չի տեղավորվում» ռեժիմն այս սարքաշարային դասից ցածր ամենաշատ հարցվող և ամենաքիչ չափված հարցն է։ Մենք այն չենք գործարկել։

Հոսանք և փող։ Գներ չենք հրապարակում — սարքաշարի գները շարժվում են, և դրանք մեջբերող լաբորատորիան վատ է ծերանում։ Մեկ թոքենի հաշվով վատտերն իրական բաց են, որը մտադիր ենք փակել, հենց չափման մեթոդաբանությունը կայունանա. մինչ այդ էլեկտրաէներգիայի թվեր նույնպես չունենք։

Եթե ուղեցույցը վստահորեն ծածկում է այս ամենը, ստուգիր՝ արդյոք դրանցից գեթ մեկը չափել է։

Ինչպե՞ս գնել՝ առանց որևէ մեկին վստահելու, ներառյալ մեզ

Որոշիր workload-ը, հետո ամեն կարդացած թվից պահանջիր. ինչ սարք և firmware, runtime-ի ինչ build, մոդելի ինչ արտեֆակտ և քվանտ, ինչ prompt և ելքի երկարություն, ինչ զուգահեռություն, լարի որ կողմը, քանի կրկնություն։ Արձանագրությունը գրված է այստեղ, իսկ harness-ը հրապարակային է — մեր քշած սառեցված workload-ներն այն են, որ կարող ես գործարկել տուփի վրա գնումից առաջ կամ հետո։

Մեկ տողով չափված պատասխան ունեցող հաճախակի հարցերն ինդեքսավորված են պատասխանների էջում. վերևի ամեն թիվ ունի մշտական էջ՝ իր շրջանակով, սահմանափակումներով և հում ապացույցով, claim-երի ռեեստրում։

Առնչվող ստուգված կոնֆիգուրացիաներ

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-21). Ի՞նչ սարքաշար լոկալ LLM-ի համար. չափված պատասխան՝ ըստ workload-ի. Evidence level: lab_repeated. https://agmind.ai/hy/reports/local-llm-homelab-hardware/
← Հաշվետվություններ