Отчёт

Сколько токенов в секунду достаточно локальной LLM?

Самый частый и наименее измеренный вопрос локального AI обычно закрывают выдуманными круглыми числами. Как скорость ощущается на реальной коробке: ожидание до первого полезного слова, поток после него и отказ, при котором токены в секунду теряют смысл.

lab_repeated internal research 20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Честный ответ: «достаточно» — не одно число, потому что вопрос прячет три разных ощущения — сколько ждать первого полезного слова, как быстро течёт текст после него и приходит ли ответ вообще. Форумы отвечают круглыми порогами, которых никто не измерял. Вот чем каждое из трёх ощущений является на одной реальной коробке, где каждая цифра несёт свою конфигурацию.

Почему одно число tok/s — не та линза?

Одна цифра пропускной способности усредняет две вещи, которые человек реально чувствует: паузу до появления хоть чего-нибудь и темп после. Два сетапа с одинаковым средним tok/s могут ощущаться мгновенными или сломанными — смотря где сидит время. Хуже того, самое ходовое число скорости в интернете — декод tok/s из синтетического бенчмарка — не измеряет ни одно из двух ощущений под реальным промптом. Поэтому разрежем вопрос так, как его режет восприятие.

Сколько ждать первого полезного слова?

На повседневных запросах с выключенным reasoning эта коробка показывает первый токен ответа за 210мсunit_replicated — ниже порога, на котором человек вообще регистрирует ожидание. Та же модель с включённым reasoning тратит 20191мсunit_replicated до первого видимого слова, а наивный дашборд, смотрящий на первый токен чего угодно, отчитался бы про 212мсunit_replicated — поток размышлений стартует мгновенно и адресован не вам. Если забирать с этой страницы один метод: измеряйте до первого токена ответа, иначе метрика вам соврёт.

Как быстро должен течь ответ?

Темп чтения — естественная мерка: текст, приходящий быстрее, чем вы читаете, ощущается беглой речью, медленнее — диктовкой. Эта коробка декодирует на 15.9мс/токенrepeated на повседневном корпусе — с запасом впереди темпа чтения. Конфигурация двигает это число сильнее, чем зависть к чужому железу: более тяжёлый квант Q8_0 замедляет его до 18.7мс/токенrepeated, а бэкенд ROCm — до 18.7мс/токенrepeated — выбор кванта и бэкенда стоит больше, чем большинство планов апгрейда.

Переживает ли скорость компанию и время?

Цифры, снятые в одиночку на первой минуте, льстят коробке. Под четырьмя одновременными чатами первый токен ответа всё ещё приходит за 338мсrepeated; при восьми — за 865мсrepeatedполная лестница и есть способ рассчитать общую коробку. А за три непрерывных часа обслуживания темп декода сдвинулся на 1.6%single_run — скорость, которая не выцветает к концу рабочего дня.

Когда скорость перестаёт иметь значение?

Модель может быть быстрой и не отдать ничего: под жёстким бюджетом токенов с включённым reasoning эта коробка вернула 58.3% запросовunit_replicated запросов как HTTP 200 с пустым ответом — бюджет ушёл на размышления, вам не досталось ничего. Другое семейство моделей в режиме по умолчанию показало 8.3% запросовrepeated на том же корпусе. Никакая цифра токенов в секунду этого не ловит — ровно поэтому мы измеряем это отдельно и ровно поэтому разговор о скорости, который это игнорирует, неполон.

Так сколько же «достаточно»?

Для одиночного чата на этом классе железа: коробка выше уже прошла точку, где скорость была узким местом — первое слово ниже порога восприятия, поток впереди темпа чтения. Для общей коробки читайте лестницу конкурентности против ожидания, которое вытерпят ваши пользователи. Для автоматизации метрика — сквозное время на завершённый, парсящийся ответ — измерено здесь. А для любого сетапа с включённым reasoning заложите бюджет на режим отказа раньше, чем на пропускную способность.

Если страница предлагает вам один универсальный порог tok/s вместо этих измерений — она цитирует настроение. Метод измерить собственную коробку расписан здесь; у каждой цифры выше есть постоянная страница с сырыми прогонами в реестре.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-20). Сколько токенов в секунду достаточно локальной LLM?. Evidence level: lab_repeated. https://agmind.ai/ru/reports/how-many-tokens-per-second-is-enough/
← Отчёты