Հետազոտություններ
Հաշվետվություններ
Հրապարակային հետազոտական հաշվետվություններ՝ սառեցված կոնֆիգուրացիաներ, արդյունքները՝ սահմանափակումների հետ կողք կողքի, բացասական արդյունքները՝ ներառված, raw ապացույցները՝ կցված։ Նախագրանցումը գործում է ֆլագմանային որակավորումից սկսած — մինչ այժմ հրապարակվածը կոնվեյերն ապացուցող աշխատանք է և ուղղակի ասում է դա։
Ընթացքի մեջ
Strix Halo Runtime Qualification v1 — llama.cpp Vulkan vs ROCm երկու միանման Beelink GTR9 Pro-ի վրա, AMD gfx1151 vLLM կոնտեյների որակավորում, long-context սանդուղք և 30-րոպեանոց endurance։ Նախագրանցումը կոմիտվում է առաջին headline գործարկումից առաջ։
- lab_repeated internal researchBeelink GTR9 Pro-ն լոկալ LLM-ների համար. ինչ չափեցին երկու միավորները սպասարկման մեկ ամսում
Գրախոսություններն այս տուփը բենչմարքում են մեկ շաբաթ։ Մենք գնեցինք երկուսը, սառեցրինք workload-ները և այդ պահից դրանցից սպասարկում ենք. աշխատող սոֆթ-ստեկը, չափված թվերը, որտեղ երկու միավորները համընկան, և այն, ինչի համար դեռևս չենք երաշխավորում։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchvLLM-ը DGX Spark-ի վրա 256K կոնտեքստով. կոնֆիգուրացիաների որսը և NVFP4 ուղին, որը կոտրված էր mainline-ում
256K կոնտեքստի կոնֆիգուրացիաների որսը մեկ GB10-ի վրա. vLLM-ի որ attention և MoE բэкենդները դիմացան SM_121-ին, ինչու NVFP4-ը մեր ամրացրած mainline-սարքումում դեկոդում էր FP8-ից դանդաղ, որ պատչված կապակցումը պահեց 260K-ն — և չափված թվերը՝ ամրացված ներսում նշված տարբերակներին։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԻ՞նչ սարքաշար լոկալ LLM-ի համար. չափված պատասխան՝ ըստ workload-ի
Լոկալ AI-ի սարքաշարային ուղեցույցների գրեթե ամբողջը սպեկ-թերթիկ է, վենդորի ինքնագրախոսություն կամ VRAM-աստիճաններ վերարտադրող ցուցակ։ Այս էջը սկսում է workload-ից, բերում է միայն մեր տուփերի վրա չափված թվերը և բացահայտ անվանում այն ուղիները, որոնց մասին տվյալ չունենք։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchՌուսերեն retrieval-էմբեդեր 24 մլն պարամետրում — և մեկ թիվը, որը քիչ էր մնում փչացներ այն
strizh-ru-retriever-ի պատմությունը. ինչպես RuModernBERT-small-ը շերտային prune-ով դարձավ քառաշերտ էնկոդեր, ինչու դիստիլյացիայի կարճ ուղին տվեց գեղեցիկ loss և մեռած որոնում, ինչ պահեց սեղմումը — և կոնֆիգում մոռացված արժեքը, որ լուռ կտրում էր ամեն մուտք։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchՌուսերեն RAG-սպլիտեր, որը փաստաթղթերը կտրում է ինդեքսներով, ոչ թե տեքստը վերաշարադրելով
agmind-rag-splitter-ru-ի պատմությունը. ինչու է տեքստ վերաշարադրող չանկերը վտանգավոր RAG-ի համար, ինչպես LoRA-դոուսուցումը սովորեց վերադարձնել սահմանների ինդեքսներ JSON-ով, կողքին հրապարակված ուսուցողական կորպուսը — և ազնիվ բացը ուսուցչի հետ համաձայնության ու որոնման որակի միջև։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchՀիշողությունը Strix Halo-ի վրա. ինչու է ROCm-ը 128 ԳԲ-ից փշրանքներ տեսնում, և ինչ կարգավորել BIOS-ի փոխարեն
Ryzen AI Max+ 395 տուփի ամենահաճախ հանդիպող առաջին խափանումը. մոդելը չի տեղավորվում, կամ runtime-ը 128 ԳԲ մեքենայի վրա ցույց է տալիս մի քանի գիգաբայթ VRAM։ BIOS-ը գրեթե միշտ սխալ լծակն է։ Ինչ է հաղորդում մեր սերվինգ հանգույցի sysfs-ը և որ պարամետրն է որոշում։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchՄեկ տուփը՝ կեղտոտ, մյուսը՝ մաքուր. երկու նոդանոց տնային AI-լաբը, որ թվերը պահում է ազնիվ
Մեր երկու նույնական Strix Halo միավորներն ապրում են հակադիր կյանքերով. մեկը կրում է ամբողջ կոնտեյներային ստեկը, մյուսը սպասարկում է մեկ մոդել և մնում դատարկ։ Բաժանումը կոկիկություն չէ. harness-ն անվավեր է ճանաչում ցանկացած գործարկում, որի հոսթի վրա GPU-հարևան է գտնվել։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchllama.cpp, vLLM թե՞ Ollama. ինչո՞վ գործարկել լոկալ LLM-ը սեփական սերվերի վրա
Շրջանառվող խորհուրդները գրված են տվյալների կենտրոնի GPU-ների բենչմարքներից և հազվադեպ են դիմանում մեկ տուփի հետ հանդիպմանը։ Ինչի համար է իրականում ամեն engine-ը, որն ու որտեղ ենք քշում մենք և ինչու, և դեֆոլտների հարցը, որն ավելի ծանր է կշռում, քան բուն ընտրությունը։
21 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԼոկալ LLM-ները հորինո՞ւմ են պատասխաններ, երբ փաստաթուղթը դրանք չի պարունակում։ Չափեցինք
Բոլորը հարցնում են՝ լոկալ մոդելը հորինո՞ւմ է իրենց փաստաթղթերի վրա; գրեթե ոչ ոք դա չի չափում։ Մեր workload-ում ներկառուցված է անպատասխան կոնտրոլ. հարցեր, որոնց փաստաթուղթը պատասխանել չի կարող, գնահատված ըստ այն բանի, թե մոդելը դա խոստովանո՞ւմ է։ Երկու ընտանիք, չիմանալու երկու ձև։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchՔանի՞ թոքեն վայրկյանում է բավարար լոկալ LLM-ի համար
Լոկալ AI-ի ամենահաճախ տրվող և ամենաքիչ չափված հարցը, որին սովորաբար պատասխանում են հորինված կլոր թվերով։ Ահա թե ինչ է արագությունն իրապես զգացվում իրական տուփի վրա. սպասումը մինչև առաջին օգտակար բառը, հոսքը դրանից հետո և ձախողումը, որը ցանկացած tok/s թիվ դարձնում է անիմաստ։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchԻնչպես բենչմարքել լոկալ LLM-ը, որ թվերը դիմանան ստուգմանը
Հրապարակված լոկալ LLM արագությունների մեծ մասի հետ նույնիսկ չհամաձայնել հնարավոր չէ. դրանք կոնֆիգուրացիա չեն կրում։ Պրոտոկոլ հում գործարկումներ հրապարակող լաբորատորիայից. ինչ ամրագրել, ինչ հարցնել աշխատող սերվերին, որ թոքենները հաշվել, և ինչու են ձախողումները հայտարարի մասը։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԿարո՞ղ է լոկալ LLM-ը հուսալիորեն վերադարձնել խիստ JSON. չափված քվանտների, backend-ների և մոդելների միջով
Խիստ JSON ելքը լոկալ ավտոմատացման կրող պատն է, իսկ դրա հուսալիությունը սովորաբար հայտարարվում է, ոչ թե չափվում։ Մեկ տուփի վրա քվանտավորումն այն չշարժեց, backend-ը չշարժեց, reasoning ռեժիմը չշարժեց — շարժեց մոդելային ընտանիքի փոխարինումը։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԱնջատե՞լ thinking-ը. ինչ արժե reasoning ռեժիմը լոկալ LLM-ի վրա՝ չափված
Reasoning ռեժիմը լոկալ մոդելի վրա առաջին տեսանելի բառը հապաղեցնում է աչքի թարթումից մինչև սպասում և բազմապատկում ավտոմատացման գինը, իսկ մեր gate-երի կոշտ ճիշտ պատասխանով ամեն խնդրի վրա ոչինչ չգնեց։ Չափված փոխանակումը և այն սահմանը, որտեղից խորհուրդն այլևս չի գործում։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchStrix Halo թե՞ DGX Spark լոկալ AI-ի համար։ Ինչ չափեցինք երկու տուփի վրա էլ
Լոկալ AI մինի-տուփերի դասի ամենաորոնվող համեմատությանն ամենուր պատասխանում են սպեկ-թերթիկները, ոչ թե երկուսն էլ չափող լաբորատորիան։ Երկու պլատֆորմն էլ մերն են։ Ահա ինչ արեց ամեն մեկը չափելիորեն, որ workload-ը որ տուփին է պատկանում, և համեմատությունը, որ հրաժարվում ենք կեղծել։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԻնչ է իրականում աշխատեցնում 128 ԳԲ unified հիշողությունը. լոկալ LLM-ներ՝ չափված
128 ԳԲ unified հիշողության դասն այսօր լոկալ LLM տուփերի ոսկե միջինն է, և դրա մասին գրվածի գրեթե ամբողջը սպեկ-թերթիկի թվաբանություն է։ Ահա ինչ է մեկ այդպիսի տուփ չափելիորեն անում. որ դասի մոդել է սպասարկում, ինչ արագ, քանի հոգու համար, և որտեղ է 128 ԳԲ-ն ավարտվում։
20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchDeepSeek-V4-Flash 0731-ը երկու DGX Spark-ի վրա. բաղադրատոմսը՝ նշված թակարդներով
Մեր հրապարակված GB10 թվերի հետևի ճշգրիտ սերվինգի բաղադրատոմսը. ամրագրված կշիռներ ու պատկեր, head-first գործարկման կարգը TCPStore-ի կախումի դեմ, MoE դրոշակը, որն auto-ն բաց է թողնում, ինչ մոնիտորել, երբ NVML-ը լռում է, և ինչ թվեր սպասել։
16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchGPU մոնիտորինգ DGX Spark-ի վրա. երբ dcgm-exporter-ը մեռած է, իսկ NVML-ը պատասխանում է N/A
Ստանդարտ GPU observability ստեկը GB10-ի unified memory-ի վրա կիսատ է աշխատում. dcgm-exporter-ը չի գործում, NVML-ը հարցումների զգալի մասին վերադարձնում է N/A, և Grafana-ն մնում է կանաչ ու դատարկ։ Կոլեկտորը, որով իրականում սպասարկում ենք vLLM-ը, և ինչպես կառուցել այն։
16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchԱրժե՞ արդյոք DGX Spark-ը լոկալ LLM աշխատանքի համար. չափված պատասխան
Նիշայի ամենահաճախ տրվող գնորդական հարցին պատասխանում են գրեթե բացառապես սպեկ-թերթիկների թվաբանությամբ։ Ահա ինչ իրականում արեց GB10 հանգույցների զույգը մեր լաբորատորիայում — 284B MoE-ի սերվինգ, կոնտեքստի կոր մինչև միլիոն թոքեն — և ում արժե գնել այն, ում՝ ոչ։
16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԻնչու է փաստաթղթի հետ չաթը մեկ անգամ դանդաղ, հետո՝ ակնթարթային. llama.cpp-ի prompt cache-ը՝ չափված
Փաստաթղթային Q&A սեսիա Ryzen AI Max+ 395 տուփի վրա. ինչ արժե առաջին հարցը 32k թոքենանոց ֆայլի վրա, ինչ՝ երկրորդը միացրած և անջատած prompt cache-ով, և միակ պայմանը, առանց որի cache-ն ոչինչ չի խնայում։
16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchQ8_0, թե՞ Q4_K_M. ինչ է ավելի մեծ քվանտն իրականում տալիս՝ չափված մեկ տուփի վրա
Նույն մոդելը, նույն llama.cpp build-ը, նույն Strix Halo տուփը, փոխվել է միայն քվանտավորումը. ինչ է Q8_0-ն արժենում դեկոդի տեմպով Q4_K_M-ի դիմաց, ինչ տեսան մեր որակի gate-երը, և որ պակասը պետք է իրականում որոշի ընտրությունը։
16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchԵրեք ժամ բեռի տակ. դանդաղո՞ւմ է Strix Halo մինի-համակարգիչն աշխատանքային օրվա ընթացքում
Անընդհատ եռաժամյա սերվինգ-անցում երկու նույնական Ryzen AI Max+ 395 միավորի վրա՝ չորս զուգահեռությամբ. որքան շեղվեց դեկոդի տեմպն առաջին հինգ րոպեի և վերջինի միջև, և հարցումների որ բաժինը վերադարձավ ամբողջական պատասխանով։
16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchHTTP 200 և դատարկ պատասխան. խափանման ռեժիմը, որը ձեր մոնիտորինգը չի տեսնում
Reasoning-մոդելը կարող է ամբողջ թոքեն-բյուջեն ծախսել մտորումների վրա և վերադարձնել հաջող պատասխան՝ օգտատիրոջը տեսանելի զրո տեքստով։ Չափեցինք, թե որքան հաճախ է դա պատահում մոդելների երկու ընտանիքի վրա — և ինչու են TTFT դաշբորդներն այդ պահին իդեալական տեսք ունենում։
14 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԿիրիլյան հարկը. որքան է ռուսերեն տեքստն իրականում արժենում թոքեններով, չափված
Մեր long-context կորպուսը կտրվել էր «նիշ մեկ թոքենին» գնահատականով, որը դիմացավ անգլերենին և ռուսերենի վրա վրիպեց մեկ երրորդով։ Չափված արժեքները հրապարակված են — ահա ինչ են դրանք ասում կիրիլիցայի կոնտեքստային պատուհանների պլանավորման և մեր իսկ սխալ պիտակի որսի մասին։
14 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchԻնչու են DGX Spark-ի վրա DeepSeek-ի հրապարակված արագությունները միմյանց հակասում
Նույն մոդելը նույն երկու GB10 հանգույցի վրա հրապարակվում է հիսունականների վերջից մինչև յոթանասունականների սկիզբ ընկած արագություններով։ Այդ թվերից ամեն մեկը կարող է ճիշտ լինել — ահա յուրաքանչյուրի հետևի կոնֆիգուրացիան։
13 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchՔանի՞ մարդ կարող է իրականում կիսել 128 ԳԲ-անոց մեկ լոկալ AI-տուփ
Չափված զուգահեռության սանդուղք մեկ Strix Halo-ի վրա. ինչպիսին է սպասումը մեկ, չորս և ութ միաժամանակյա չաթերի դեպքում, ինչը մնաց ճիշտ, և ինչու «թոքեն վայրկյանում»-ը թիմի չափի հարցին չի պատասխանում։
12 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchՍպեկուլյատիվ DSpark երկու DGX Spark-ի վրա. խորության կորը մինչև միլիոն թոքեն
Մեր fp8 DSpark bring-up-ը GB10-ի վրա, կոմյունիթի NVFP4 բիլդի անկախ վերարտադրություն և խորության տվյալներ, որ ոչ ոք չէր հրապարակել. միահոսք կորը մինչև իրական միլիոն թոքենանոց prompt — գումարած երկու բացասական արդյունք, նշված իրենց անուններով։
05 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_single_run internal researchvLLM auto-ն սխալ MoE միջուկ ընտրեց DeepSeek-V4-Flash-ի համար GB10-ի վրա
DeepSeek-V4-Flash-0731-ը երկու DGX Spark հանգույցի վրա. պատկերը պարունակում է MoE միջուկ այս մոդելի MXFP4 փորձագետների համար այս սիլիցիումի վրա, բայց auto-ն այն բաց է թողնում։ Ձեռքով ընտրությունն արժե դեկոդի երկնիշ տոկոսներ։ Բաղադրատոմսն ու հում արդյունքները բաց են։
03 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchԵրկրորդ մոդել, երկրորդ քվանտ, երկրորդ բեքենդ. ի՞նչ է տեղափոխվում մեկ արկղի վրա
Նույն Strix Halo միավորը, երեք փոխարինում՝ մեկը միանգամից. մոդելների երկրորդ ընտանիքը վերարտադրում է դատարկ պատասխանների ռեժիմը; Q8_0-ն այս workload-ների վրա ոչ մի չափելի բան չի գնում; ROCm-ն աշխատում է gfx1151-ի վրա, բայց դեկոդում է Vulkan-ից դանդաղ։
03 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- lab_repeated internal researchTime-to-first-token-ը ոչինչ չի ասում մտածող մոդելի մասին
Strix Halo արկղի վրա սովորական TTFT թիվը գերազանց տեսք ուներ, մինչդեռ հարցումների մեծ մասը HTTP 200-ով դատարկ պատասխան էր վերադարձնում։ Կլիենտային չափումներ, երեք աշխատանքային ռեժիմ, evidence-փաթեթները կցված են։
02 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- legacy internal researchDeepSeek-V4-Flash DSpark 2× DGX Spark-ի վրա. 1M կոնտեքստ — legacy արդյունքներ
DSpark սպեկուլյատիվ դեկոդավորման bring-up GB10-ի (sm_121) վրա 200G RoCE-ով, խորության կորը մինչև մեկ միլիոն թոքեն, կոմյունիթի բիլդի անկախ վերարտադրություն և երկու ազնիվ բացասական արդյունք։
31 հուլիսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
- legacy internal researchՄուլտիսլոտ LLM-ինֆերենս Strix Halo-ի վրա — legacy արդյունքներ
Ինչ է անում մեկ Strix Halo մինի-համակարգիչը 128 ԳԲ-ով 32 զուգահեռ չաթ-հոսքի տակ. բաղադրատոմսեր, կոնկուրենտության կտրուկ անկում 8 հարցումից հետո բոլոր կոնֆիգուրացիաներում, և որտեղ սպեկուլյատիվ դեկոդավորումն այլևս չի օգնում։
31 հուլիսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն
Արտաքին հրապարակումներ
Լաբորատորիայի ռուսալեզու հետազոտական հոդվածները Habr-ում։ Հղումներ են, ոչ հայելիներ — բնօրինակներն այնտեղ են։
- DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57 ռուսերեն
DeepSeek-V4-Flash-ը երկու DGX Spark նոդի վրա — լոնգրիդը մեր MoE-backend հաշվետվության հետևում, ներառյալ ուրիշի թվի քննությունը, որը չէր համընկնում մերի հետ։
03 օգոստոսի, 2026 թ. · habr.com
- Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой ռուսերեն
Ռուսերեն retrieval-էմբեդերի սեղմումը և մեկ թվի սխալը, որը քիչ էր մնում ամեն ինչ փչացներ։
28 հուլիսի, 2026 թ. · habr.com
- Мини-ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки ռուսերեն
Multi-slot serving-ի հետազոտությունը մեր legacy-հաշվետվության հետևում — ներառյալ երեք սեփական սխալ, հրապարակված։
18 հուլիսի, 2026 թ. · habr.com
- Два AMD Strix Halo в AI-инфраструктуре: 34 контейнера на одном, ~70 tok/s Qwen3.6 на другом ռուսերեն
Ինչպես է իրականում աշխատում երկու Strix Halo-ից բաղկացած պարկը. ծառայությունների ստեկը մեկի վրա, ինֆերենսը՝ մյուսի։
13 հուլիսի, 2026 թ. · habr.com
- DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново ռուսերեն
DeepSeek-ի սպեկուլյատիվ դեկոդերի պորտը GB10-ի վրա — մեկ տողի բագը և նորից չափված բենչմարքները։
05 հուլիսի, 2026 թ. · habr.com
- Как я обучил русский RAG-сплиттер, который режет документы по индексам, а не по тексту ռուսերեն
Ինդեքսներով կտրող ռուսերեն փաստաթղթային սպլիտերի ուսուցումը — այն, որ հրապարակված է Hugging Face-ում։
04 հուլիսի, 2026 թ. · habr.com
- DeepSeek-V4-Flash на двух DGX Spark: как мы убрали очередь и получили multi-user ռուսերեն
Մեկ հոսքի հերթից մինչև իրական multi-user serving երկու GB10-ից բաղկացած կլաստերի վրա։
22 հունիսի, 2026 թ. · habr.com
- DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан ռուսերեն
vLLM-ի կոնֆիգուրացիաների սանդղում 256K կոնտեքստում — և mainline-ում կոտրված NVFP4 ուղին, փաստագրված։
09 մայիսի, 2026 թ. · habr.com
- Кириллица в LLM: почему русский язык в нейросетях стоит дороже и работает медленнее ռուսերեն
Ինչու է կիրիլիցան թոքեններով ավելի թանկ և ավելի դանդաղ — ռուսերենի թոքենիզացիայի էկոնոմիկան։
07 մայիսի, 2026 թ. · habr.com
- DGX Spark: мониторинг unified memory, когда NVML и dcgm-exporter молчат ռուսերեն
GB10-ի unified memory-ի մոնիտորինգը, երբ NVIDIA-ի ստանդարտ գործիքները լռում են։
06 մայիսի, 2026 թ. · habr.com
- Как я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло ռուսերեն
Մասնավոր AI-սերվերի ստեկի հավաքումը DGX Spark-ի վրա — այստեղից սկսվեց AGmind-ի ինստալերների գիծը։
03 մայիսի, 2026 թ. · habr.com