# Сколько токенов в секунду достаточно локальной LLM?

> Самый частый и наименее измеренный вопрос локального AI обычно закрывают выдуманными круглыми числами. Как скорость ощущается на реальной коробке: ожидание до первого полезного слова, поток после него и отказ, при котором токены в секунду теряют смысл.

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/how-many-tokens-per-second-is-enough/

Честный ответ: «достаточно» — не одно число, потому что вопрос прячет три
разных ощущения — сколько ждать первого полезного слова, как быстро течёт
текст после него и приходит ли ответ вообще. Форумы отвечают круглыми
порогами, которых никто не измерял. Вот чем каждое из трёх ощущений
является на одной реальной коробке, где каждая цифра несёт свою
конфигурацию.

## Почему одно число tok/s — не та линза?

Одна цифра пропускной способности усредняет две вещи, которые человек
реально чувствует: паузу до появления хоть чего-нибудь и темп после. Два
сетапа с одинаковым средним tok/s могут ощущаться мгновенными или
сломанными — смотря где сидит время. Хуже того, самое ходовое число
скорости в интернете — декод tok/s из синтетического бенчмарка — не
измеряет ни одно из двух ощущений под реальным промптом. Поэтому разрежем
вопрос так, как его режет восприятие.

## Сколько ждать первого полезного слова?

На повседневных запросах с выключенным reasoning эта коробка показывает
первый токен ответа за
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)) — ниже
порога, на котором человек вообще регистрирует ожидание. Та же модель с
включённым reasoning тратит
**20191 ms** ([strix.qwen36.interactive2.c1.ttfa-thinking](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-thinking/)) до первого
видимого слова, а наивный дашборд, смотрящий на первый токен *чего
угодно*, отчитался бы про
**212 ms** ([strix.qwen36.interactive2.c1.ttft-any-token](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttft-any-token/)) — поток
размышлений стартует мгновенно и адресован не вам. Если забирать с этой
страницы один метод: измеряйте до первого токена *ответа*, иначе
[метрика вам соврёт](https://agmind.ai/ru/reports/ttft-thinking-model-strix-halo/).

## Как быстро должен течь ответ?

Темп чтения — естественная мерка: текст, приходящий быстрее, чем вы
читаете, ощущается беглой речью, медленнее — диктовкой. Эта коробка
декодирует на
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) на повседневном
корпусе — с запасом впереди темпа чтения. Конфигурация двигает это число
сильнее, чем зависть к чужому железу: более тяжёлый квант Q8_0 замедляет
его до **18.7 ms/token** ([strix.qwen36q8.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)), а бэкенд
ROCm — до **18.7 ms/token** ([strix.qwen36q4.rocm.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.itl-nothink/)) — выбор
[кванта](https://agmind.ai/ru/compare/q4km-vs-q80-qwen36-strix-halo/) и
[бэкенда](https://agmind.ai/ru/compare/llamacpp-vulkan-vs-rocm-strix-halo/) стоит больше,
чем большинство планов апгрейда.

## Переживает ли скорость компанию и время?

Цифры, снятые в одиночку на первой минуте, льстят коробке. Под четырьмя
одновременными чатами первый токен ответа всё ещё приходит за
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)); при
восьми — за
**865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)) —
[полная лестница](https://agmind.ai/ru/reports/concurrency-capacity-strix-halo/) и есть
способ рассчитать общую коробку. А за три непрерывных часа обслуживания
темп декода сдвинулся на
**1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/)) — скорость,
которая
[не выцветает к концу рабочего дня](https://agmind.ai/ru/reports/strix-halo-sustained-load-3-hours/).

## Когда скорость перестаёт иметь значение?

Модель может быть быстрой и не отдать ничего: под жёстким бюджетом токенов
с включённым reasoning эта коробка вернула
**58.3 % of requests** ([strix.qwen36.interactive2.c1.answerless-1k](https://agmind.ai/claims/strix.qwen36.interactive2.c1.answerless-1k/)) запросов
как HTTP 200 с пустым ответом — бюджет ушёл на размышления, вам не
досталось ничего. Другое семейство моделей в режиме по умолчанию показало
**8.3 % of requests** ([strix.gemma4.interactive2.c1.answerless-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.answerless-default/)) на том
же корпусе. Никакая цифра токенов в секунду этого не ловит — ровно поэтому
[мы измеряем это отдельно](https://agmind.ai/ru/reports/answerless-http-200/) и ровно
поэтому разговор о скорости, который это игнорирует, неполон.

## Так сколько же «достаточно»?

Для одиночного чата на этом классе железа: коробка выше уже прошла точку,
где скорость была узким местом — первое слово ниже порога восприятия,
поток впереди темпа чтения. Для общей коробки читайте лестницу
конкурентности против ожидания, которое вытерпят ваши пользователи. Для
автоматизации метрика — сквозное время на завершённый, *парсящийся*
ответ — [измерено здесь](https://agmind.ai/ru/reports/local-llm-json-reliability/). А для
любого сетапа с включённым reasoning заложите бюджет на режим отказа
раньше, чем на пропускную способность.

Если страница предлагает вам один универсальный порог tok/s вместо этих
измерений — она цитирует настроение. Метод измерить собственную коробку
[расписан здесь](https://agmind.ai/ru/reports/how-to-benchmark-local-llm/); у каждой цифры
выше есть постоянная страница с сырыми прогонами в
[реестре](https://agmind.ai/ru/claims/).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
