Отчёт

Кириллический налог: сколько русский текст реально стоит в токенах, измерено

Наш long-context корпус резался по оценке «символов на токен» — она держалась на английском и промахнулась на треть на русском. Измеренные счётчики опубликованы: что это значит для контекстных окон кириллицы и как мы поймали свою ошибку.

lab_repeated internal research 14 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Любой план контекстного окна начинается с допущения, сколько символов помещается в токен. Наше оказалось неверным для русского — публично, в замороженном корпусе — и измеренная поправка полезнее исходных чисел, поэтому мы опубликовали её как данные, а не тихо пересобрали корпус.

Что мы предполагали и что намерили

Long-context корпус резался на номинальные ступени 2k/8k/16k/32k токенов по оценке символов на токен: около 4 для английской прозы и 2.2 для русской. Английское допущение выдержало; русское — нет. Поштучные измеренные значения, снятые с собственного prompt-eval учёта рантайма и опубликованные в tokens-measured.json

:
Элемент корпуса (номинал)Оценка токеновИзмереноОтношение
en-32k (Диккенс)32034300050.94
ru-2k (Достоевский)205413720.67
ru-8k806152950.66
ru-16k16059104150.65
ru-32k32044210620.66

Английский лёг в пределах ~6% от номинала. Русский — примерно на две трети: этот токенизатор (Qwen3.6, вшит в GGUF) тратит на литературный русский примерно 3.3 символа на токен, а не 2.2, как предполагал сборщик корпуса

.

Что это значит на практике

Как это всплыло (и что сделало с нашими же этикетками)

Ошибка разметки поймана при ревизии нашей long-context работы: поле approx_tokens корпуса разошлось с собственным учётом сервера в наших же опубликованных логах. Сам файл корпуса заморожен хэшем и не менялся; измеренные значения теперь лежат рядом с ним, поправка зафиксирована в errata, а опубликованные клеймы по глубинам — только английские и потому не задеты. Затронутые русские ступени везде подписаны измеренными значениями.

Более глубокий разбор — почему кириллица токенизируется дорого, на нескольких токенизаторах, с экономикой — в нашем лонгриде на Habr.

Ограничения

Как цитировать

AGmind Systems Lab (2026-08-14). Кириллический налог: сколько русский текст реально стоит в токенах, измерено. Evidence level: lab_repeated. https://agmind.ai/ru/reports/cyrillic-token-cost/
← Отчёты