Հաշվետվություն

Կիրիլյան հարկը. որքան է ռուսերեն տեքստն իրականում արժենում թոքեններով, չափված

Մեր long-context կորպուսը կտրվել էր «նիշ մեկ թոքենին» գնահատականով, որը դիմացավ անգլերենին և ռուսերենի վրա վրիպեց մեկ երրորդով։ Չափված արժեքները հրապարակված են — ահա ինչ են դրանք ասում կիրիլիցայի կոնտեքստային պատուհանների պլանավորման և մեր իսկ սխալ պիտակի որսի մասին։

lab_repeated internal research 14 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Կոնտեքստային պատուհանի ամեն պլան սկսվում է ենթադրությունից, թե քանի նիշ է տեղավորվում մեկ թոքենում։ Մերը ռուսերենի համար սխալ դուրս եկավ — հրապարակայնորեն, սառեցված կորպուսում — և չափված ուղղումն ավելի օգտակար է, քան սկզբնական թվերը, ուստի հրապարակեցինք այն որպես տվյալներ՝ կորպուսը լուռ վերակառուցելու փոխարեն։

Ինչ էինք ենթադրում և ինչ չափեցինք

Long-context կորպուսը կտրվում էր 2k/8k/16k/32k թոքենի անվանական աստիճանների՝ նիշ-մեկ-թոքենին գնահատականով. մոտ 4 անգլերեն արձակի համար և 2.2՝ ռուսերենի։ Անգլերեն ենթադրությունը դիմացավ; ռուսերենը՝ ոչ։ Տարր առ տարր չափված արժեքները, վերցված runtime-ի սեփական prompt-eval հաշվառումից և հրապարակված tokens-measured.json ֆայլում .

Կորպուսի տարր (անվանական աստիճան)Գնահատված թոքեններՉափված թոքեններՀարաբերակցություն
en-32k (Դիքենս)32034300050.94
ru-2k (Դոստոևսկի)205413720.67
ru-8k806152950.66
ru-16k16059104150.65
ru-32k32044210620.66

Անգլերենը մնաց անվանականից ~6%-ի սահմաններում։ Ռուսերենը դուրս եկավ մոտ երկու երրորդի վրա. այս թոքենիզատորը (Qwen3.6-ինը, ներդրված GGUF-ում) գրական ռուսերենի վրա ծախսում է մոտ 3.3 նիշ մեկ թոքենին, ոչ թե 2.2, ինչպես ենթադրել էր կորպուսի կառուցողը ։

Ինչ է սա նշանակում գործնականում

Ինչպես սա երևան եկավ (և ինչ արեց մեր իսկ պիտակների հետ)

Սխալ պիտակը բռնվեց մեր long-context աշխատանքի վերանայման ժամանակ. կորպուսի approx_tokens դաշտը շեղվեց սերվերի սեփական հաշվառումից մեր իսկ հրապարակված գործարկման լոգերում։ Կորպուսի ֆայլն ինքը սառեցված է հեշով և չի փոխվել; չափված արժեքներն այժմ դրված են նրա կողքին, ուղղումը գրանցված է errata էջում, իսկ խորությունների հրապարակված claim-երը միայն անգլերեն են և հետևաբար չեն տուժել։ Տուժած ռուսերեն աստիճաններն ամենուր, որտեղ հանդիպում են, պիտակված են չափված արժեքներով։

Ավելի խորը նախապատմությունը — ինչու է կիրիլիցան թանկ թոքենիզացվում, մի քանի թոքենիզատորի վրա, տնտեսագիտությամբ հանդերձ — մեր ռուսերեն լոնգրիդում է Habr-ում։

Սահմանափակումներ

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-14). Կիրիլյան հարկը. որքան է ռուսերեն տեքստն իրականում արժենում թոքեններով, չափված. Evidence level: lab_repeated. https://agmind.ai/hy/reports/cyrillic-token-cost/
← Հաշվետվություններ