Մեթոդ
Workload-ների գրադարան
Ֆիքսված, տարբերակավորվող բեռնվածքներ՝ սառեցված կորպուսներով, հեշերով և acceptance ստուգումներով։ Որակավորման արդյունքն իմաստ ունի միայն workload-ի կոնկրետ ռևիզիայի նկատմամբ — էական փոփոխությունը ստեղծում է նոր ռևիզիա, ոչ թե լուռ թարմացում։
Released workload-ներն ունեն սառեցված, hash-ով ամրագրված կորպուսներ և չափված գործարկումներ — հրապարակված claim-ները հենվում են դրանց վրա։ Սևագրերն ունեն սահմանված ինքնություն, բայց չսառեցված կորպուսներ — հրապարակային headline պնդումների համար դրանք չեն օգտագործվում։
- interactive-assistant-v1 released
Արձագանքո՞ղ է արդյոք մեկ օգտատիրոջ streaming-չաթն այս համակարգում։
Կլիենտական TTFT, միջթոքենային ուշացում և e2e ժամանակ սառեցված 16 տարրից բաղկացած EN+RU կորպուսի վրա (երկարության երեք միջակայք); ֆորմատի, լեզվի և կրկնությունների gate-եր՝ տարր առ տարր ակնկալիքներով։
- interactive-assistant-v2 released
Արձագանքո՞ղ է մեկ օգտատիրոջ streaming-չաթն այս համակարգում առօրյա մարդկային խնդիրներում։
Նույն կոնտրակտը, ինչ v1-ում — կլիենտական TTFT, միջթոքենային ուշացում, e2e ժամանակ; ֆորմատի, լեզվի և կրկնությունների gate-եր — բայց մարդկային խնդիրների կորպուսի վրա. առօրյա հարցումներ (հաղորդագրություններ, նամակներ, բացատրություններ, պլաններ)՝ ինքնահղումային բենչմարք-հարցերի փոխարեն։ 16 տարր, EN+RU, երկարության երեք միջակայք։
- team-serving-v1 Սևագիր
Հարցումների ի՞նչ հոսքի է դիմանում համակարգը հայտարարված SLO-ի սահմաններում։
Պլանավորված կոնտրակտ (ինքնությունը դեռ սառեցված չէ). սանդղում ըստ concurrency-ի (closed-loop) գումարած open-loop ռեժիմ սառեցված trace-ով; goodput vs throughput; ձախողված հարցումները մնում են հայտարարում; արդյունքը operating envelope է։
- long-context-v1 released
Որքա՞ն է օգտակար կոնտեքստի խորությունը այս համակարգում, ոչ թե պարզապես կարգավորվողինը։
Ասեղի որոնում կոնտեքստի անվանական 2k/8k/16k/32k սանդուղքով — 12 տարր, EN (Դիքենս) + RU (Դոստոևսկի); պրոմպտի չափված թոքեններն անվանականից ցածր են (EN՝ ~6%-ի սահմաններում, RU՝ ~65%) և հրապարակված են կորպուսի կողքին — գումարած unanswerable հսկիչներ՝ առկա դիստրակտորով; ֆորմատի, լեզվի, կրկնությունների, ասեղի և հսկիչի gate-եր; որակ, TTFT և e2e ժամանակ ամեն խորության վրա։
- structured-agent-v1 released
Հուսալի՞ է մնում խիստ JSON ելքն առօրյա ավտոմատացման խնդիրներում այս համակարգում։
16 դետերմինիստական տարր, EN+RU, երեք տիպի խնդիր — դուրսբերում ճշգրիտ ground truth-ով, դասակարգում փակ պիտակների բազմություններով, գեներացիա կառուցվածքային կոնտրակտով։ Խիստ JSON պարսինգը գումարած բանալի առ բանալի համեմատությունը տարանջատում են պարսինգի հաջողությունը խնդրի հաջողությունից; կրկնությունների gate-ը մոտարկում է ցիկլերի հայտնաբերումը։ Գործիքների կատարման sandbox այս ռևիզիայում չկա։
- endurance-30m-v1 released
Դեգրադացվո՞ւմ է համակարգը երկարատև բեռի տակ, և կոնկրետ ե՞րբ։
Պտտեցնում է interactive-assistant-v2 մարդկային կորպուսը closed-loop ռեժիմով concurrency 4-ով 180 րոպե տևողությամբ; հարցում առ հարցում մեկնարկի շեղումները տալիս են 5-րոպեանոց պատուհաններ՝ 30/60/180 րոպե checkpoint-ներով; պատուհանային միջթոքենային ուշացում, TTFT և հարցումների հաջողություն; ֆորմատի, լեզվի և կրկնությունների gate-եր։ Id-ի «30m»-ը պատմական է. առաջին checkpoint-ը։
- rag-pipeline-ru-v0 Ներքին
Կոնկրետ որտե՞ղ է ռուսալեզու RAG-փայփլայնը կորցնում որակը՝ բաղադրիչ առ բաղադրիչ։
Գնահատում բաղադրիչ առ բաղադրիչ. OCR CER/WER → սպլիտերի սահմանների F1 → Recall@k/nDCG → reranker-ի դելտա → գեներացիայի support/abstention/citations։ Ներքին է մինչև 6 release gate-երի անցնելը։
- doc-session-v1 released
Երկրորդ հարցը նույն տեղադրված փաստաթղթի շուրջ նորի՞ց է վճարում ամբողջ prefill-ը։
Կլիենտական ժամանակ մինչև առաջին թոքենը հարցազույգերի համար, որոնք կիսում են բայթ առ բայթ նույնական փաստաթղթի պրեֆիքս (1 warmup տարր + 4 փաստաթուղթ, 8k/32k թոքեն, EN+RU), սերվերի prompt cache-ն անջատած (baseline) և միացրած վիճակում; ֆորմատի/լեզվի/կրկնությունների gate-եր պատասխանների վրա։