AGmind Systems Lab
Լոկալ LLM-ներ իրական երկաթի վրա։ Չափված։
Որքան արագ է պատասխանում 35B դասի մոդելը 128 ԳԲ տուփի վրա, ինչ է իրապես քաշում DGX Spark զույգը, որ քվանտն ու backend-ն ընտրել — չափված սեփական երկաթի վրա՝ հրապարակված հում գործարկումներով և ձախողումները հայտարարում պահած։
Սարքի սպեցիֆիկացիան ասում է, թե որքան հիշողություն կա դրա մեջ։ Դեմո-բենչմարկը տալիս է մեկ թիվ։ Ոչ մեկը, ոչ մյուսը չի պատասխանում, թե արդյոք կարելի է շահագործել ձեր ճշգրիտ մոդելն ու runtime-ը ձեր իրական ծանրաբեռնվածության տակ։ AGmind Systems Lab-ը ստուգում է համակարգն ամբողջությամբ և յուրաքանչյուր եզրակացություն սահմանափակում է նրանով, ինչ իրականում գործարկվել է։
01Ապացույցներ
Ստուգված կոնֆիգուրացիաներ
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — փաստաթղթի սեսիայի քեշ
- Համակարգ:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ԳԲ unified
- Workload:
- doc-session-v1 @ 2026-08-03 — ընդհանուր պրեֆիքսով հարցերի զույգեր 8k/32k թոքենանոց փաստաթղթերի վրա, EN+RU
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — երեք ժամ անընդհատ ծանրաբեռնվածության տակ
- Համակարգ:
- 2× Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ԳԲ unified — մեկ անցում՝ յունիթին, կողք կողքի
- Workload:
- endurance-30m-v1 @ 2026-08-03 — human-կորպուսը closed-loop ցիկլով 180 րոպե, չեկփոինթներ՝ 30/60/180 ր
- PARTIAL activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — կենցաղային օգնական
- Համակարգ:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ԳԲ unified — մեկ օգտատիրոջ բջիջները ռեպլիկացված են երկրորդ՝ կոմերցիոն առումով նույնական յունիթի վրա
- Workload:
- interactive-assistant-v2 @ 2026-08-02 — 16 կենցաղային խնդիր, EN+RU
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — որոնում տեղադրված փաստաթղթում
- Համակարգ:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ԳԲ unified
- Workload:
- long-context-v1 @ 2026-08-03 — ասեղի սանդուղք, նոմինալ աստիճաններ 2k–32k (EN չափված 1.8k–30.0k, RU 1.4k–21.1k), կոնտրոլներով
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — խիստ JSON ավտոմատացումների համար
- Համակարգ:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ԳԲ unified
- Workload:
- structured-agent-v1 @ 2026-08-03 — 16 դետերմինիստական JSON-խնդիր, EN+RU
Թարմ հաշվետվություններ
Բոլոր կոնֆիգուրացիաները →- Beelink GTR9 Pro-ն լոկալ LLM-ների համար. ինչ չափեցին երկու միավորները սպասարկման մեկ ամսում
Գրախոսություններն այս տուփը բենչմարքում են մեկ շաբաթ։ Մենք գնեցինք երկուսը, սառեցրինք workload-ները և այդ պահից դրանցից սպասարկում ենք. աշխատող սոֆթ-ստեկը, չափված թվերը, որտեղ երկու միավորները համընկան, և այն, ինչի համար դեռևս չենք երաշխավորում։
- vLLM-ը DGX Spark-ի վրա 256K կոնտեքստով. կոնֆիգուրացիաների որսը և NVFP4 ուղին, որը կոտրված էր mainline-ում
256K կոնտեքստի կոնֆիգուրացիաների որսը մեկ GB10-ի վրա. vLLM-ի որ attention և MoE բэкենդները դիմացան SM_121-ին, ինչու NVFP4-ը մեր ամրացրած mainline-սարքումում դեկոդում էր FP8-ից դանդաղ, որ պատչված կապակցումը պահեց 260K-ն — և չափված թվերը՝ ամրացված ներսում նշված տարբերակներին։
- Ի՞նչ սարքաշար լոկալ LLM-ի համար. չափված պատասխան՝ ըստ workload-ի
Լոկալ AI-ի սարքաշարային ուղեցույցների գրեթե ամբողջը սպեկ-թերթիկ է, վենդորի ինքնագրախոսություն կամ VRAM-աստիճաններ վերարտադրող ցուցակ։ Այս էջը սկսում է workload-ից, բերում է միայն մեր տուփերի վրա չափված թվերը և բացահայտ անվանում այն ուղիները, որոնց մասին տվյալ չունենք։
- Ռուսերեն retrieval-էմբեդեր 24 մլն պարամետրում — և մեկ թիվը, որը քիչ էր մնում փչացներ այն
strizh-ru-retriever-ի պատմությունը. ինչպես RuModernBERT-small-ը շերտային prune-ով դարձավ քառաշերտ էնկոդեր, ինչու դիստիլյացիայի կարճ ուղին տվեց գեղեցիկ loss և մեռած որոնում, ինչ պահեց սեղմումը — և կոնֆիգում մոռացված արժեքը, որ լուռ կտրում էր ամեն մուտք։
- Ռուսերեն RAG-սպլիտեր, որը փաստաթղթերը կտրում է ինդեքսներով, ոչ թե տեքստը վերաշարադրելով
agmind-rag-splitter-ru-ի պատմությունը. ինչու է տեքստ վերաշարադրող չանկերը վտանգավոր RAG-ի համար, ինչպես LoRA-դոուսուցումը սովորեց վերադարձնել սահմանների ինդեքսներ JSON-ով, կողքին հրապարակված ուսուցողական կորպուսը — և ազնիվ բացը ուսուցչի հետ համաձայնության ու որոնման որակի միջև։
- Հիշողությունը Strix Halo-ի վրա. ինչու է ROCm-ը 128 ԳԲ-ից փշրանքներ տեսնում, և ինչ կարգավորել BIOS-ի փոխարեն
Ryzen AI Max+ 395 տուփի ամենահաճախ հանդիպող առաջին խափանումը. մոդելը չի տեղավորվում, կամ runtime-ը 128 ԳԲ մեքենայի վրա ցույց է տալիս մի քանի գիգաբայթ VRAM։ BIOS-ը գրեթե միշտ սխալ լծակն է։ Ինչ է հաղորդում մեր սերվինգ հանգույցի sysfs-ը և որ պարամետրն է որոշում։
02Ուղեցույցներ
Տեղակայման ուղեցույցներ
- Ինչպես տեղակայել մեծ MoE DGX Spark-ի վրա vLLM-ով. մեկ հանգույցից մինչև զույգ
Տեղակայման հերթականությունը, որը շրջանցում է մեր GB10 զույգի վրա բռնած լուռ կախումները. ամրագրված կշիռներ և image, head-ը peer-ից առաջ, պատրաստվածությունը endpoint-ով, ոչ թե զգացողությամբ, և MoE միջուկի ընտրության ստուգումը, որն արագ կոնֆիգը բաժանում է սովորականից։
2-3 ժ
- Ինչպես տեղակայել լոկալ LLM Strix Halo-ի վրա (Ryzen AI Max+ 395). llama.cpp՝ զրոյից մինչև առաջին պատասխան
Ուղին, որով տեղակայում ենք մեր սեփական տուփերի վրա. հիշողության կարգավորումը, որի մասին BIOS-ը լռում է, ամրագրված llama.cpp կոնտեյներ Vulkan-ի վրա և երեք ստուգում, որ սերվերն իրոք աշխատում է — ներառյալ երկու խափանում, որոնք թաքնվում են կանաչ ստատուսների հետևում։
45 րոպե
- Ollama Strix Halo-ի վրա (Ryzen AI Max+ 395). տեղադրում, GPU-ի դետեկտ, առաջին մոդելը
Ollama-ի տեղադրումը Strix Halo տուփի վրա լռելյայն ուղով և բոլորին շփոթեցնող լոգ-տողի վերծանումը. ինչու է Vulkan ուղին դեն նետում ձեր iGPU-ն, ինչու է ROCm-ը, միևնույն է, վերցնում այն, և ինչպես ստուգել, որ մոդելն իրոք նստել է GPU-ի վրա, ոչ թե լուռ աշխատում է CPU-ի վրա։
20 րոպե
03Ազնվություն
Ձախողումներ և ուղղումներ
Բացասական արդյունքներն այստեղ լաբորատորիայի լիարժեք պրոդուկտ են։ Վճարովի թեստը, որը հերքել է հայտարարությունը, հրապարակվում է (անկախ ռեժիմում) նույն խստությամբ, ինչ հաստատումը։ Errata-ում գրանցվում է հրապարակված արդյունքների յուրաքանչյուր ուղղում։
Errata քաղաքականությունը →04Մեթոդ
Մեթոդաբանություն
Յուրաքանչյուր որակավորում անցնում է նույն վերահսկվող պրոցեսով՝ համաձայնեցված հարց, սառեցված տարբերակներ և workload, մետրիկաներ և բացառման կանոններ՝ ֆիքսված գործարկումներից առաջ (հրապարակային նախագրանցում՝ ֆլագմանից սկսած), պահպանված ձախողումներ ու անվավեր գործարկումներ, սահմանափակ եզրակացություն և վերարտադրելի evidence bundle։ Ամեն headline թիվ կրում է ապացույցի մակարդակ, որն ասում է, թե որքան չափում կա դրա հետևում — մեկ գործարկման արդյունքները նշվում են որպես այդպիսին և երբեք չեն ներկայացվում որպես կրկնված; ձախողված հարցումները մնում են հայտարարի մեջ։
Կարդալ մեթոդաբանությունը →05Ստենդներ
Լաբորատորիայի երկաթը
Ստենդները, որոնք իրականում կան լաբորատորիայում՝ իրենց սահմանափակումներով։ Ոչ մի արդյունք չի ընդհանրացվում թեստավորված յունիթից և տարբերակներից դուրս։
| Ստենդ | Սպեցիֆիկացիա | Դեր | Սահմանափակում | Կարգավիճակ |
|---|---|---|---|---|
| 2× Beelink GTR9 Pro — AMD Strix Halo | Ryzen AI Max+ 395, 128 ԳԲ LPDDR5X-8000 unified, Radeon 8060S (gfx1151), երկու 10GbE — երկու առևտրայնորեն նույնական յունիթ | Որակավորման ֆլագմանային թիրախ. backend-երի համեմատություն (Vulkan vs ROCm), վերարտադրում յունիթից յունիթ, multi-slot serving, RAG-ծառայություններ | Երկու յունիթը չի ներկայացնում ամբողջ արտադրական խմբաքանակը | online |
| 2× NVIDIA DGX Spark — GB10 | GB10 Grace Blackwell, 20-միջուկանի Arm, 128 ԳԲ unified, sm_121, ConnectX-7 — միացված կետ առ կետ 200G RoCE-ով | aarch64/sm_121 տեղափոխելիություն, multi-node տոպոլոգիաներ, long-context և speculative decoding | Թանկ ու նեղ ստենդ; արդյունքները չեն ընդհանրացվում datacenter-ի Blackwell-ի վրա | online |
| RTX 5090 workstation | Սպառողական Blackwell, 32 ԳԲ GDDR7, x86 հոսթ | Հսկիչ CUDA-գիծ, fine-tuning/դիստիլյացիա, բազային չափումներ սպառողական GPU-ի վրա | Մեկ կոնֆիգուրացիա; ոչ enterprise-սերվեր | online |
| Apple M1 Max, 64 GB | Apple Silicon, 64 ԳԲ unified, macOS / MLX-գիծ | Apple/MLX smoke-թեստեր և փոքր միջպլատֆորմային խարիսխներ | Ոչ Apple-ի ընթացիկ բարձրակարգ սերունդը | online |
| MacBook Pro — Apple M4 Pro, 24 GB | Apple Silicon M4 Pro, 24 ԳԲ unified, macOS / MLX-գիծ | Apple-ի ընթացիկ սերնդի խարիսխ. նոութբուքի դասի լոկալ ինֆերենս, MLX-ի և llama.cpp Metal-ի համեմատություններ | 24 ԳԲ-ը սահմանափակում է մոդելի չափը; նոութբուքի ջերմային ռեժիմ, ոչ դեսկթոփի | online |
| Laptop — Ryzen 9 9955HX + RTX 5070 Ti | Ryzen 9 9955HX (Zen 5, 16 միջուկ), RTX 5070 Ti Laptop 12 ԳԲ GDDR7, 32 ԳԲ DDR5 | Դիսկրետ GPU-ով նոութբուքների գիծ. մոբայլ Blackwell CUDA, ինֆերենս VRAM-ի դեֆիցիտի պայմաններում և offload-սցենարներ unified-հիշողությամբ մեքենաների դիմաց | 12 ԳԲ VRAM-ը միջին մոդելների համար ստիպում է offload; նոութբուքի ջերմային ռեժիմ | online |
06Ծառայություններ
Ինչ է որակավորում AGmind-ը
-
Vendor Claim Evidence Pack
Ճի՞շտ է արդյոք համակարգի մասին մեկ կոնկրետ հրապարակային պնդումը հայտարարված պայմաններում։
Վճիռ՝ ապացույցներով. raw արտեֆակտներ, սահմանափակումներ, վերարտադրման բաղադրատոմս։
-
Workload Capacity Qualification
Ի՞նչ բեռնվածության է դիմանում հենց այս համակարգը մեր workload-ի և SLO-ի ներքո։
Operating envelope՝ խորհուրդ տրվող միջակայք, միջակայք սահմանափակումներով, SLO-ի ձախողման սահման, հայտնի խափանումների ռեժիմներ։
-
Runtime/Model Portability Sprint
Կարելի՞ է մեր exact runtime-ը/մոդելը գործարկել Strix Halo-ի, GB10-ի, RTX-ի կամ Apple Silicon-ի վրա, և ի՞նչ է դրա համար պահանջվում։
Ախտորոշում՝ ձախողման ճշգրիտ կետերով, այնուհետև (ցանկության դեպքում) patch-եր/flag-եր/կառուցման բաղադրատոմսեր՝ commissioned engineering մակնշմամբ։
-
Long-Context Reliability Qualification
Որքա՞ն կոնտեքստ է իրականում օգտակար այս համակարգում, և ոչ թե որքանն է տեղավորվում հիշողության մեջ։
Օգտակար կոնտեքստի վճիռ ըստ խորությունների՝ որակի ապացույցներով, ուշացումների պրոֆիլով և խափանումների փաստագրմամբ։
-
Procurement Decision Pack
2–4 թեկնածու համակարգերից ո՞րը գնել մեր workload-ի համար։
Համեմատություն կողք կողքի՝ ապացույցներով և բացահայտ սահմանափակումներով, առանց ունիվերսալ միավորի։
-
Air-Gapped Readiness Check
Կտեղադրվի՞ և կաշխատի՞ արդյոք այս ստեկը ցանցի մեկուսացված սեգմենտում։
Տեխնիկական հսկողությունների ստուգված ստուգաթերթ՝ յուրաքանչյուրի համար ապացույցներով։
Առայժմ գիտակցաբար չենք առաջարկում
Սրանք պրոդուկտ կդառնան միայն այն ժամանակ, երբ վճարովի պահանջարկն ապացուցի, որ դրանք պետք են՝
- AGmind Reference Stack demand gate-ից հետո
- Release Revalidation Channel demand gate-ից հետո
- BenchOps demand gate-ից հետո
07Workloads
Workload-ների գրադարան
Որակավորումը գործարկվում է ֆիքսված, տարբերակավորվող workload-ների վրա, ոչ թե պատահական պրոմպտների։ Բոլոր v1 workload-ները սևագիր են, քանի դեռ դրանց կորպուսները, հեշերը և acceptance ստուգումները սառեցված չեն։
- interactive-assistant-v1 released
Արձագանքո՞ղ է արդյոք մեկ օգտատիրոջ streaming-չաթն այս համակարգում։
- interactive-assistant-v2 released
Արձագանքո՞ղ է մեկ օգտատիրոջ streaming-չաթն այս համակարգում առօրյա մարդկային խնդիրներում։
- team-serving-v1 Սևագիր
Հարցումների ի՞նչ հոսքի է դիմանում համակարգը հայտարարված SLO-ի սահմաններում։
- long-context-v1 released
Որքա՞ն է օգտակար կոնտեքստի խորությունը այս համակարգում, ոչ թե պարզապես կարգավորվողինը։
- structured-agent-v1 released
Հուսալի՞ է մնում խիստ JSON ելքն առօրյա ավտոմատացման խնդիրներում այս համակարգում։
- endurance-30m-v1 released
Դեգրադացվո՞ւմ է համակարգը երկարատև բեռի տակ, և կոնկրետ ե՞րբ։
- rag-pipeline-ru-v0 Ներքին
Կոնկրետ որտե՞ղ է ռուսալեզու RAG-փայփլայնը կորցնում որակը՝ բաղադրիչ առ բաղադրիչ։
- doc-session-v1 released
Երկրորդ հարցը նույն տեղադրված փաստաթղթի շուրջ նորի՞ց է վճարում ամբողջ prefill-ը։
08Scope
Պատվիրել որակավորում
Դուք գնում եք վերահսկվող պրոցես, ոչ թե դրական արդյունք։ Վճարը կախված չէ վճռից, ֆինանսավորումը բացահայտվում է, իսկ անկախ թեստերն առանձնացված են commissioned engineering-ից։