Отчёт

Железо для локальной нейросети: какой ПК собрать под какую задачу, по измерениям

Гайды по железу для локальных нейросетей — это спеклисты, продавцы в роли обозревателей и партнёрские подборки. Здесь иначе: сначала ворклоад, потом коробка, каждая цифра измерена на нашем железе, а неизмеренные дорожки названы пробелами.

lab_repeated internal research 21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Коротко: сначала выбирают ворклоад, потом коробку. Личный ассистент, домашний сервер на небольшую команду и стенд под миллион токенов — три разные покупки, и решающая цифра у каждой своя. Ниже то, что наше железо измеримо сделало на каждом ворклоаде, и, что не менее важно, те ворклоады, по которым у нас данных нет и мы отказываемся их выдумывать.

Почему подборки железа для локальных нейросетей так плохи

Любой запрос вида «какой ПК собрать для нейросетей» выдаёт страницы одной конструкции: таблица видеокарт по объёму VRAM, абзац арифметики памяти, рекомендация. Ищешь измерение под рекомендацией — обычно его нет. Вендоры ранжируются в собственных категориях: в топе по мини-ПК регулярно стоят продавцы мини-ПК, обозревающие сами себя. Партнёрские подборки цитируют темп генерации, который через несколько пересказов сводится к двум-трём первоисточникам, растерявшим по дороге модель, квант, длину контекста и рантайм. Эта потеря и есть вся проблема: цифра бенчмарка — это конфиг под прикрытием, а цифра без конфига о покупке не говорит ничего.

Эта страница скромнее по охвату и, как нам кажется, полезнее: что два класса железа, которыми мы владеем, реально сделали на замороженных ворклоадах, с каждой цифрой, ведущей на свои сырые прогоны.

Начинать надо с ворклоада, а не с коробки

Почти любой выбор железа под локальный AI решают четыре вопроса. Ответьте на них до того, как откроете первую спецификацию.

Сколько людей? Ассистент одного человека и команда из пяти — разные машины, и дело не в скорости как таковой, а в том, как растёт ожидание под конкурентностью.

Какой длины промпты? Чат и «вставь документ на пятьдесят страниц» нагружают машину в разных местах. Второй упирается в префилл, который ведёт себя совсем не как генерация.

Насколько велика модель на самом деле? Не число параметров — класс. MoE класса 35B и модель на 284B живут по разные стороны границы, которую никакой объём unified-памяти в одной коробке не переходит.

Работает ли она целый день? Коробка, быстрая десять минут, и коробка, держащая темп восемь часов, — разные продукты, и в спецификациях эта разница не появляется.

Сколько памяти нужно локальной нейросети: что делает мини-ПК на 128 ГБ

Наша рабочая лошадка: машина на Ryzen AI Max+ 395 со 128 ГБ unified-памяти, llama.cpp запинен по digest образа, обслуживает MoE класса 35B. Всё ниже измерено на замороженных ворклоадах, отказы оставлены в знаменателе.

Личный ассистент. Первый токен ответа за 210мсunit_replicated, декод идёт на 15.9мс/токенrepeated — ниже порога, на котором человек замечает ожидание, и быстрее темпа чтения. Для одного пользователя на повседневных задачах этот класс коробок перестал быть узким местом.

Небольшая команда. На четырёх одновременных чатах медианное ожидание первого слова — 338мсrepeated, на восьми — 865мсrepeated, а завершаемость держится на 100.0% запросовrepeated. Вся лестница — это способ считать ёмкость честно: выбираете ожидание, которое ваши люди терпят, и идёте по таблице в обратную сторону.

Длинные документы. Первый вопрос по документу в 32k токенов стоит 33965мсrepeated — это счёт за префилл; если берёте коробку под документные процессы, смотрите на него, а не на скорость декода. Останьтесь в сессии, и кеш промпта вернёт следующий вопрос за 860мсrepeated; механика и единственное условие, которое ей нужно, значат здесь больше железа.

Целый день. Три непрерывных часа на конкурентности четыре сдвинули темп декода на 1.6%single_run, и так на двух коммерчески одинаковых юнитах. Отчёт о длительной нагрузке отвечает на вопрос «уйдёт ли мини-ПК в троттлинг, если оставить его обслуживать».

Автоматизация. Задачи со строгим JSON выполнялись на 100.0% запросовrepeated — и переменной надёжности оказалась модель, а не настройки.

Что этот класс памяти запускает вообще — отдельная страница; полные измеренные таблицы лежат в репозитории бенчмарков.

Что делает пара DGX Spark

Второй класс, которым мы владеем: два юнита GB10, соединённых линком 200G, обслуживают MoE на 284B параметров через vLLM. Это ответ на конкретный вопрос — запустить фронтирный открытый класс под собственной крышей, — и идёт он в комплекте с эксплуатационным домашним заданием: флаг выбора ядер, который автоматический режим пропускает, штатный мониторинг GPU, работающий наполовину, и кривая контекста до миллиона токенов, первое заполнение которой — событие, которое планируют, а не запрос, который просто отправляют. Измеренный ответ покупателю, включая то, кому её брать не стоит, — отдельная страница; сравнение в две колонки с коробкой Strix — здесь.

Какая коробка под какой ворклоад

Читаем собственные измерения как решение:

Мини-ПК или сборка с видеокартой: чего мы НЕ измеряли

Это раздел, который остальные гайды по железу опускают, и поэтому наш короток там, где их гайды уверенны.

Сборки с дискретной видеокартой. Одна и две карты класса RTX, вопрос про б/у 3090, вопрос про 5090 — они доминируют в выдаче, и первичных данных по ним у нас нет. На наших стендах дорожка CUDA заявлена, опубликованных прогонов по ней нет, значит и утверждений мы не делаем. Появятся прогоны — придут с сырыми данными, как всё остальное.

Apple Silicon. Дорожка заявлена, опубликованных прогонов ноль, утверждений ноль.

Только CPU и выгрузка при малом VRAM. Режим «модель не влезает» — самый спрашиваемый и наименее измеренный вопрос ниже этого класса железа. Мы его не гоняли.

Ватты и деньги. Цен мы не публикуем: цены на железо гуляют, а лаборатория, которая их цитирует, плохо стареет. Ватты на токен — реальный пробел, и мы собираемся его закрыть, когда устоится методика замера; до тех пор цифр по электричеству у нас тоже нет.

Если гайд уверенно закрывает всё это разом, проверьте, измерял ли он хоть что-нибудь из списка.

Как покупать, не доверяя никому, включая нас

Определите ворклоад, а дальше требуйте от любой прочитанной цифры: какое устройство и прошивка, какая сборка рантайма, какой артефакт модели и квант, какой промпт и длина ответа, какая конкурентность, с какой стороны провода снято, сколько повторов. Протокол описан здесь, а харнесс открыт — замороженные ворклоады, которые гоняем мы, вы можете прогнать на коробке до покупки или после.

Частые вопросы с однострочными измеренными ответами собраны на странице ответов; у каждой цифры выше есть постоянная страница со скоупом, ограничениями и сырыми доказательствами в реестре клеймов.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-21). Железо для локальной нейросети: какой ПК собрать под какую задачу, по измерениям. Evidence level: lab_repeated. https://agmind.ai/ru/reports/local-llm-homelab-hardware/
← Отчёты