Сколько токенов в секунду достаточно для локальной LLM?
«Достаточно» распадается на три измеримых ощущения: ожидание первого полезного слова, темп после него и придёт ли ответ вообще — одна круглая цифра их не вместит.
Доказательства →Измеренные ответы
Вопросы, которые реально задают, в формулировках, которыми их задают. Здесь ответ в одно предложение; каждая цифра, скоуп и сырой прогон — в одном клике. Про неизмеренное так и написано.
«Достаточно» распадается на три измеримых ощущения: ожидание первого полезного слова, темп после него и придёт ли ответ вообще — одна круглая цифра их не вместит.
Доказательства →Поток размышлений стартует мгновенно, но адресован не вам; первое видимое слово ждёт его конца. Меряйте до первого токена ответа — иначе дашборд назовёт это молчание быстрым.
Доказательства →Модель читает весь документ, прежде чем сказать хоть что-то, и этот счёт за префилл растёт с длиной — измерено на двух глубинах на одной коробке при заморозке всего остального.
Доказательства →Кеш промпта: бит-в-бит одинаковый префикс платит за префилл один раз. Всё, что переписывает префикс — перетасованные RAG-чанки, системный промпт с таймстемпом — молча заставляет платить каждый вопрос.
Доказательства →Класс 35B-MoE работает с первым словом быстрее секунды и запасом по памяти; фронтирные 284B в одну коробку не влезают — потребовалась пара. Измерено, а не посчитано по спекам.
Доказательства →Нашим гейтам — нет, на этой модели и этих ворклоадах; а вот цена Q8_0 в темпе декода реальна и постоянна. Неудобный вывод: дефолтный совет «бери самый большой квант» тратит скорость на неразличимое.
Доказательства →В нашей конфигурации Vulkan декодировал быстрее при идентичной корректности на всех гейтах — неправильный бэкенд стоил примерно как удвоение точности весов.
Доказательства →Мы меряем это контрольными вопросами без ответа: одно семейство отклонило все невозможные вопросы, другое иногда падало в молчание — не в выдумку. Оба поведения невидимы, пока их не тестируешь.
Доказательства →Измеренная лестница на одном, четырёх и восьми одновременных чатах показывает нелинейный рост ожидания при стабильной завершаемости — размер считайте от терпимого ожидания, а не от маркетинговых мест.
Доказательства →Три часа непрерывной замкнутой нагрузки на двух одинаковых юнитах: темп первой минуты оказался темпом третьего часа. Предсказанное «вспыхнет и сдуется» не пришло.
Доказательства →Reasoning-модель может потратить весь бюджет токенов на размышления и не выдать ничего адресованного вам — транспорт рапортует успех, пользователь получает пустоту. Мы измерили, как часто, по моделям и бюджетам.
Доказательства →Для чата и структурной автоматизации на нашей коробке — да: thinking стоил один-два порядка ожидания и не купил ничего различимого гейтами. Для по-настоящему сложного reasoning наши ворклоады — не ваше доказательство.
Доказательства →Надёжность оказалась свойством модели, а не настроек: квант, бэкенд и режим reasoning не сдвинули успех задач — смена семейства модели сдвинула.
Доказательства →Лоб в лоб при одном бюджете и корпусе: модель, которая дольше размышляет, гораздо чаще исчерпывает место, не сказав ничего — и оба отказа приходят как HTTP 200.
Доказательства →Сначала ворклоад: личный ассистент, небольшая команда, работа с документами и фронтирный класс моделей — четыре разные покупки. Отвечаем тем, что наши коробки реально показали, и честно называем дорожки, которых не мерили.
Доказательства →На Linux модели живут в GTT, а не в выделенном в BIOS куске, и потолок задаёт параметр ядра TTM, а не меню прошивки. Наша нода держит выделенный кусок минимальным и при этом хранит сотню гигабайт весов.
Доказательства →Разные инструменты, которые рынок сравнивает в лоб: измеренная рабочая лошадка для класса моделей, который реально гоняют, против единственного настольного пути к крупнейшему открытому MoE-классу — парой и со швами.
Доказательства →Она обслужила 284B MoE дома и прошла кривую контекста до миллиона токенов; это же — настоящая эксплуатационная работа с полуживым штатным мониторингом. Измеренный ответ покупателю называет, кому брать, а кому нет.
Доказательства →dcgm-exporter на GB10 не работает, а NVML отдаёт N/A на многое из того, на что вы алертитесь; надёжный путь — парсить текст nvidia-smi через textfile-коллектор, с алертом на протухание самого коллектора.
Доказательства →Спросите работающий сервер, что он реально гоняет, запиньте всё до байта, заморозьте ворклоад, считайте правильные токены, держите отказы в знаменателе, повторяйте — и публикуйте конфиг рядом с цифрой.
Доказательства →Потому что опубликованная цифра — переодетый конфиг: неназванные профили нагрузки, дефолты, уехавшие между версиями, прошивки, которых никто не указал. Большинство расхождений растворяется, стоит привязать каждую цифру к её конфигурации.
Доказательства →Нами пока не измерено. Цифры сообщества сильно расходятся без запиненных digests; квалификационный прогон запланирован. До тех пор эта страница чужих цифр цитировать не будет.
Доказательства →Заявленная линия на нашем стенде с нулём опубликованных прогонов — значит, ноль клеймов. Когда ячейка MLX против llama.cpp доедет, она приедет с сырыми ранами.
Доказательства →Самый частый и наименее измеренный вопрос ниже этого класса железа. Offload-исследование — заявленная линия; ничего не опубликовано, значит, ничего не утверждается.
Доказательства →