Коротко: сначала выбирают ворклоад, потом коробку. Личный ассистент, домашний сервер на небольшую команду и стенд под миллион токенов — три разные покупки, и решающая цифра у каждой своя. Ниже то, что наше железо измеримо сделало на каждом ворклоаде, и, что не менее важно, те ворклоады, по которым у нас данных нет и мы отказываемся их выдумывать.
Почему подборки железа для локальных нейросетей так плохи
Любой запрос вида «какой ПК собрать для нейросетей» выдаёт страницы одной конструкции: таблица видеокарт по объёму VRAM, абзац арифметики памяти, рекомендация. Ищешь измерение под рекомендацией — обычно его нет. Вендоры ранжируются в собственных категориях: в топе по мини-ПК регулярно стоят продавцы мини-ПК, обозревающие сами себя. Партнёрские подборки цитируют темп генерации, который через несколько пересказов сводится к двум-трём первоисточникам, растерявшим по дороге модель, квант, длину контекста и рантайм. Эта потеря и есть вся проблема: цифра бенчмарка — это конфиг под прикрытием, а цифра без конфига о покупке не говорит ничего.
Эта страница скромнее по охвату и, как нам кажется, полезнее: что два класса железа, которыми мы владеем, реально сделали на замороженных ворклоадах, с каждой цифрой, ведущей на свои сырые прогоны.
Начинать надо с ворклоада, а не с коробки
Почти любой выбор железа под локальный AI решают четыре вопроса. Ответьте на них до того, как откроете первую спецификацию.
Сколько людей? Ассистент одного человека и команда из пяти — разные машины, и дело не в скорости как таковой, а в том, как растёт ожидание под конкурентностью.
Какой длины промпты? Чат и «вставь документ на пятьдесят страниц» нагружают машину в разных местах. Второй упирается в префилл, который ведёт себя совсем не как генерация.
Насколько велика модель на самом деле? Не число параметров — класс. MoE класса 35B и модель на 284B живут по разные стороны границы, которую никакой объём unified-памяти в одной коробке не переходит.
Работает ли она целый день? Коробка, быстрая десять минут, и коробка, держащая темп восемь часов, — разные продукты, и в спецификациях эта разница не появляется.
Сколько памяти нужно локальной нейросети: что делает мини-ПК на 128 ГБ
Наша рабочая лошадка: машина на Ryzen AI Max+ 395 со 128 ГБ unified-памяти, llama.cpp запинен по digest образа, обслуживает MoE класса 35B. Всё ниже измерено на замороженных ворклоадах, отказы оставлены в знаменателе.
Личный ассистент. Первый токен ответа за 210мсunit_replicated, декод идёт на 15.9мс/токенrepeated — ниже порога, на котором человек замечает ожидание, и быстрее темпа чтения. Для одного пользователя на повседневных задачах этот класс коробок перестал быть узким местом.
Небольшая команда. На четырёх одновременных чатах медианное ожидание первого слова — 338мсrepeated, на восьми — 865мсrepeated, а завершаемость держится на 100.0% запросовrepeated. Вся лестница — это способ считать ёмкость честно: выбираете ожидание, которое ваши люди терпят, и идёте по таблице в обратную сторону.
Длинные документы. Первый вопрос по документу в 32k токенов стоит 33965мсrepeated — это счёт за префилл; если берёте коробку под документные процессы, смотрите на него, а не на скорость декода. Останьтесь в сессии, и кеш промпта вернёт следующий вопрос за 860мсrepeated; механика и единственное условие, которое ей нужно, значат здесь больше железа.
Целый день. Три непрерывных часа на конкурентности четыре сдвинули темп декода на 1.6%single_run, и так на двух коммерчески одинаковых юнитах. Отчёт о длительной нагрузке отвечает на вопрос «уйдёт ли мини-ПК в троттлинг, если оставить его обслуживать».
Автоматизация. Задачи со строгим JSON выполнялись на 100.0% запросовrepeated — и переменной надёжности оказалась модель, а не настройки.
Что этот класс памяти запускает вообще — отдельная страница; полные измеренные таблицы лежат в репозитории бенчмарков.
Что делает пара DGX Spark
Второй класс, которым мы владеем: два юнита GB10, соединённых линком 200G, обслуживают MoE на 284B параметров через vLLM. Это ответ на конкретный вопрос — запустить фронтирный открытый класс под собственной крышей, — и идёт он в комплекте с эксплуатационным домашним заданием: флаг выбора ядер, который автоматический режим пропускает, штатный мониторинг GPU, работающий наполовину, и кривая контекста до миллиона токенов, первое заполнение которой — событие, которое планируют, а не запрос, который просто отправляют. Измеренный ответ покупателю, включая то, кому её брать не стоит, — отдельная страница; сравнение в две колонки с коробкой Strix — здесь.
Какая коробка под какой ворклоад
Читаем собственные измерения как решение:
- Один человек, чат и помощь с кодом — класс 128 ГБ unified делает это с запасом. Дальнейшие решения весят больше самой коробки: квантование и бэкенд сдвинули наши цифры сильнее, чем сдвинул бы типичный план апгрейда.
- Небольшая команда на чат-подобной работе — тот же класс; размер берут с лестницы конкурентности, а не по числу сотрудников.
- Работа с документами — снова тот же класс, но планировать надо вокруг префилла, а не декода, и относиться к переиспользованию сессии как к оптимизации на уровне железа.
- Фронтирный открытый класс — одна коробка его не делает. Пара сделала, со швами, и мы опубликовали и рецепт, и ловушки.
- Однопоточная работа, критичная к задержке, на тяжёлых промптах — сначала прочитайте цифры префилла выше, потом покупайте; именно здесь локальное железо разочаровывает людей чаще всего.
Мини-ПК или сборка с видеокартой: чего мы НЕ измеряли
Это раздел, который остальные гайды по железу опускают, и поэтому наш короток там, где их гайды уверенны.
Сборки с дискретной видеокартой. Одна и две карты класса RTX, вопрос про б/у 3090, вопрос про 5090 — они доминируют в выдаче, и первичных данных по ним у нас нет. На наших стендах дорожка CUDA заявлена, опубликованных прогонов по ней нет, значит и утверждений мы не делаем. Появятся прогоны — придут с сырыми данными, как всё остальное.
Apple Silicon. Дорожка заявлена, опубликованных прогонов ноль, утверждений ноль.
Только CPU и выгрузка при малом VRAM. Режим «модель не влезает» — самый спрашиваемый и наименее измеренный вопрос ниже этого класса железа. Мы его не гоняли.
Ватты и деньги. Цен мы не публикуем: цены на железо гуляют, а лаборатория, которая их цитирует, плохо стареет. Ватты на токен — реальный пробел, и мы собираемся его закрыть, когда устоится методика замера; до тех пор цифр по электричеству у нас тоже нет.
Если гайд уверенно закрывает всё это разом, проверьте, измерял ли он хоть что-нибудь из списка.
Как покупать, не доверяя никому, включая нас
Определите ворклоад, а дальше требуйте от любой прочитанной цифры: какое устройство и прошивка, какая сборка рантайма, какой артефакт модели и квант, какой промпт и длина ответа, какая конкурентность, с какой стороны провода снято, сколько повторов. Протокол описан здесь, а харнесс открыт — замороженные ворклоады, которые гоняем мы, вы можете прогнать на коробке до покупки или после.
Частые вопросы с однострочными измеренными ответами собраны на странице ответов; у каждой цифры выше есть постоянная страница со скоупом, ограничениями и сырыми доказательствами в реестре клеймов.