Измеренные ответы

Вопросы про локальные LLM — с ответами из измерений

Вопросы, которые реально задают, в формулировках, которыми их задают. Здесь ответ в одно предложение; каждая цифра, скоуп и сырой прогон — в одном клике. Про неизмеренное так и написано.

Насколько это быстро по ощущениям?

Сколько токенов в секунду достаточно для локальной LLM?

«Достаточно» распадается на три измеримых ощущения: ожидание первого полезного слова, темп после него и придёт ли ответ вообще — одна круглая цифра их не вместит.

Доказательства →

Почему думающая модель так долго молчит перед ответом?

Поток размышлений стартует мгновенно, но адресован не вам; первое видимое слово ждёт его конца. Меряйте до первого токена ответа — иначе дашборд назовёт это молчание быстрым.

Доказательства →

Почему старт с длинным документом настолько медленнее?

Модель читает весь документ, прежде чем сказать хоть что-то, и этот счёт за префилл растёт с длиной — измерено на двух глубинах на одной коробке при заморозке всего остального.

Доказательства →

Почему второй вопрос по тому же документу мгновенный?

Кеш промпта: бит-в-бит одинаковый префикс платит за префилл один раз. Всё, что переписывает префикс — перетасованные RAG-чанки, системный промпт с таймстемпом — молча заставляет платить каждый вопрос.

Доказательства →

Что помещается и что это даёт?

Какие модели потянут 128 ГБ unified-памяти?

Класс 35B-MoE работает с первым словом быстрее секунды и запасом по памяти; фронтирные 284B в одну коробку не влезают — потребовалась пара. Измерено, а не посчитано по спекам.

Доказательства →

Q4 против Q8 — разница в качестве вообще заметна?

Нашим гейтам — нет, на этой модели и этих ворклоадах; а вот цена Q8_0 в темпе декода реальна и постоянна. Неудобный вывод: дефолтный совет «бери самый большой квант» тратит скорость на неразличимое.

Доказательства →

Vulkan или ROCm на Strix Halo — что быстрее для llama.cpp?

В нашей конфигурации Vulkan декодировал быстрее при идентичной корректности на всех гейтах — неправильный бэкенд стоил примерно как удвоение точности весов.

Доказательства →

Выдумывают ли локальные LLM ответы, которых нет в документе?

Мы меряем это контрольными вопросами без ответа: одно семейство отклонило все невозможные вопросы, другое иногда падало в молчание — не в выдумку. Оба поведения невидимы, пока их не тестируешь.

Доказательства →

Делить коробку и гонять её весь день

Сколько одновременных пользователей выдержит одна локальная LLM-коробка?

Измеренная лестница на одном, четырёх и восьми одновременных чатах показывает нелинейный рост ожидания при стабильной завершаемости — размер считайте от терпимого ожидания, а не от маркетинговых мест.

Доказательства →

Затротлит ли мини-ПК, гоняя LLM весь день?

Три часа непрерывной замкнутой нагрузки на двух одинаковых юнитах: темп первой минуты оказался темпом третьего часа. Предсказанное «вспыхнет и сдуется» не пришло.

Доказательства →

Когда оно отказывает молча

Почему клиент показывает пустой ответ при HTTP 200?

Reasoning-модель может потратить весь бюджет токенов на размышления и не выдать ничего адресованного вам — транспорт рапортует успех, пользователь получает пустоту. Мы измерили, как часто, по моделям и бюджетам.

Доказательства →

Отключать ли режим thinking?

Для чата и структурной автоматизации на нашей коробке — да: thinking стоил один-два порядка ожидания и не купил ничего различимого гейтами. Для по-настоящему сложного reasoning наши ворклоады — не ваше доказательство.

Доказательства →

Может ли локальная LLM надёжно отдавать строгий JSON?

Надёжность оказалась свойством модели, а не настроек: квант, бэкенд и режим reasoning не сдвинули успех задач — смена семейства модели сдвинула.

Доказательства →

Какая модель замолкает при тесном бюджете токенов?

Лоб в лоб при одном бюджете и корпусе: модель, которая дольше размышляет, гораздо чаще исчерпывает место, не сказав ничего — и оба отказа приходят как HTTP 200.

Доказательства →

Какую коробку?

Какое железо брать под домашнюю локальную нейросеть?

Сначала ворклоад: личный ассистент, небольшая команда, работа с документами и фронтирный класс моделей — четыре разные покупки. Отвечаем тем, что наши коробки реально показали, и честно называем дорожки, которых не мерили.

Доказательства →

Почему ROCm видит несколько ГБ вместо 128 на Strix Halo?

На Linux модели живут в GTT, а не в выделенном в BIOS куске, и потолок задаёт параметр ядра TTM, а не меню прошивки. Наша нода держит выделенный кусок минимальным и при этом хранит сотню гигабайт весов.

Доказательства →

Strix Halo или DGX Spark для локального AI?

Разные инструменты, которые рынок сравнивает в лоб: измеренная рабочая лошадка для класса моделей, который реально гоняют, против единственного настольного пути к крупнейшему открытому MoE-классу — парой и со швами.

Доказательства →

Стоит ли DGX Spark своих денег под локальные LLM?

Она обслужила 284B MoE дома и прошла кривую контекста до миллиона токенов; это же — настоящая эксплуатационная работа с полуживым штатным мониторингом. Измеренный ответ покупателю называет, кому брать, а кому нет.

Доказательства →

nvidia-smi сломан на DGX Spark — как её мониторить?

dcgm-exporter на GB10 не работает, а NVML отдаёт N/A на многое из того, на что вы алертитесь; надёжный путь — парсить текст nvidia-smi через textfile-коллектор, с алертом на протухание самого коллектора.

Доказательства →

Цифры, с которыми можно спорить

Как бенчмаркать локальную LLM, чтобы цифрам поверили?

Спросите работающий сервер, что он реально гоняет, запиньте всё до байта, заморозьте ворклоад, считайте правильные токены, держите отказы в знаменателе, повторяйте — и публикуйте конфиг рядом с цифрой.

Доказательства →

Почему мои цифры не сходятся с обзорами?

Потому что опубликованная цифра — переодетый конфиг: неназванные профили нагрузки, дефолты, уехавшие между версиями, прошивки, которых никто не указал. Большинство расхождений растворяется, стоит привязать каждую цифру к её конфигурации.

Доказательства →

Спрашивают часто — ещё не измерено

Насколько быстр gpt-oss-120b на Strix Halo? ещё не измерено

Нами пока не измерено. Цифры сообщества сильно расходятся без запиненных digests; квалификационный прогон запланирован. До тех пор эта страница чужих цифр цитировать не будет.

Доказательства →

А что Apple Silicon — M-серия против этих коробок? ещё не измерено

Заявленная линия на нашем стенде с нулём опубликованных прогонов — значит, ноль клеймов. Когда ячейка MLX против llama.cpp доедет, она приедет с сырыми ранами.

Доказательства →

Что происходит на 8–24 ГБ VRAM, когда модель не влезает? ещё не измерено

Самый частый и наименее измеренный вопрос ниже этого класса железа. Offload-исследование — заявленная линия; ничего не опубликовано, значит, ничего не утверждается.

Доказательства →