Բաց արտեֆակտներ
Ինչ է կառուցում լաբորատորիան
Չափիչ լաբորատորիան, որը միայն չափում է, դժվար է ստուգել։ Այստեղ այն արտեֆակտներն են, որոնք լաբորատորիան հրապարակում է բացորոշ՝ մոդելներ, ուսուցողական դատասեթ, harness և ապացույցների արխիվ; ամեն մեկը թույլատրող լիցենզիայով, ամեն մեկը լուծում է խնդիր, որին լաբորատորիան բախվել է իր իսկ աշխատանքում։ Արտադրողականության ցուցանիշներ այստեղ չկան. չափված թվերն ապրում են claim-երի ռեեստրում։
- Մոդել Լիցենզիա: Apache-2.0 Բազա: deepvk/RuModernBERT-small
strizh-ru-retriever
Ինչ խնդիր է լուծում
Ինքնուրույն տեղակայված ռուսերեն RAG-ին պետք է առաջին փուլի ռետրիվեր, որը բավական փոքր է CPU-ի վրա մնացած ամեն ինչի կողքին աշխատելու համար — և որը query/document պրեֆիքսներ չի պահանջում, որոնք ամեն փաթաթան մոռանում է ավելացնել։
Ինչ է սա
24.4M պարամետրանոց, 4-շերտանոց նախադասությունների էնկոդեր՝ ստացված RuModernBERT-small-ի շերտային prune-ով և վերաուսուցմամբ։ Մեկ 384-չափանի էմբեդինգ ամեն տեքստի համար, առանց պրեֆիքսների, ճարտարապետությունն ընդունում է մինչև 8192 թոքեն (կոնտրաստիվ ուսուցումը 256-թոքենանոց հաջորդականություններով էր)։
- Մոդել Լիցենզիա: Apache-2.0 Բազա: t-tech/T-lite-it-2.1 (Qwen3-8B)
agmind-rag-splitter-ru
Ինչ խնդիր է լուծում
Ֆիքսված չափի կտրումը ռուսերեն փաստաթղթերը կիսում է մտքի կեսին և երկու մասի բաժանում աղյուսակներն ու կոդի բլոկները։ Որոնումն այնուհետև վերադարձնում է հատվածներ, որոնք ինքնուրույն այլևս ոչ մի բանի չեն պատասխանում։
Ինչ է սա
LoRA-դոուսուցում, որն ընդունում է նախապես համարակալված միավորների բաժանված փաստաթուղթ և վերադարձնում սահմանների ինդեքսներ գումարած թեման՝ JSON-ով; չանկերը հավաքվում են հոսթի կողմում։ v2-ում դատասեթը հասավ 28k օրինակի վեց տիպի աղբյուրներից և ավելացավ առանձնացված էտալոն՝ 140 out-of-domain իրավական փաստաթուղթ, պիտակավորված երկու անկախ մոդելների կոնսենսուսով և արբիտրաժով։
- Դատասեթ Լիցենզիա: Apache-2.0
agmind-rag-splitter-ru-data
Ինչ խնդիր է լուծում
Ռուսերեն չանկինգի մոդելների ուսուցողական տվյալները ոչ ոք չի հրապարակում, ուստի ոչ ոք չի կարող ստուգել, թե կոնկրետ ինչն է մոդելը սահման համարել։
Ինչ է սա
Սպլիտերի ուսուցողական կորպուսը՝ հրապարակված այնպես, որ պիտակավորումը հնարավոր լինի ստուգել, իսկ մոդելը՝ վերաուսուցանել ցանկացածին։
- Մոդել Լիցենզիա: Apache-2.0 Բազա: Qwen/Qwen3-1.7B
qmd-query-expansion-ru
Ինչ խնդիր է լուծում
qmd լոկալ որոնողական շարժիչի ստանդարտ query-expansion մոդելը սովորեցված է միայն անգլերենով. ռուսերեն հարցումը այն վերաշարադրում է անգլերեն հալյուցինացիա-կաղապարի, իսկ ելքի ֆորմատը քայքայվում է (upstream issue-ներ #774 և #454)։ qmd-ի BM25-ը նաև օգտագործում է Porter-ի ստեմեր, որը ռուսերենի ձևաբանությունը չի հասկանում, ուստի ընդլայնումն ինքը պետք է ծածկի բառաձևերը։
Ինչ է սա
Drop-in ռուսերեն փոխարինում՝ սովորեցված upstream finetune բաղադրատոմսով, որը տալիս է և՛ իմաստային, և՛ ձևաբանական ընդլայնումներ, որպեսզի լեքսիկական որոնումը գտնի բառաձևերը։
- Harness Լիցենզիա: Apache-2.0
agmind-bench
Ինչ խնդիր է լուծում
Հրապարակված թիվը ոչինչ չարժե, եթե այն արտադրած գործիքը փակ է. ոչ ոք չի կարող ստուգել, թե ինչն է ձախողում համարվել, և վերարտադրել բջիջը։
Ինչ է սա
Ինքը չափիչ harness-ը՝ ռաններ, workload-ների սառեցված կորպուսներ, որակի վեց gate-եր իրենց unit թեստերով, գումարած DuckDB հարցումները, որոնցով ստացվում է ամեն հրապարակված արժեք։
- Ապացույցների արխիվ Լիցենզիա: CC BY 4.0
agmind-lab
Ինչ խնդիր է լուծում
Ամփոփ աղյուսակները կարող են ցանկացած բան թաքցնել։ Առանց հարցում առ հարցում գրառումների կողմնակի մարդը մաքուր արդյունքը չի տարբերի ընտրվածից։
Ինչ է սա
Ամեն հրապարակված գործարկում՝ որպես կնքված ապացույցների փաթեթ. մանիֆեստ, հարցում առ հարցում գրառումներ՝ ներառյալ ձախողումները, gate-երի արդյունքներ, harness-ի ագրեգատներ, սերվերի լոգ և չեքսումներ — գումարած կատալոգը, որը փաթեթները կապում է claim-երի հետ։
Արտեֆակտը նկարագրող թվերը (պարամետրերի քանակ, էմբեդինգի չափ, դատասեթի ծավալ) հենց արտեֆակտի հատկություններն են՝ ստուգելի իր էջում։ Այն ամենը, թե որքան արագ կամ որքան լավ է աշխատում համակարգը, չափվում է և ապրում իր ապացույցների հետ claim-երի ռեեստրում.