# Железо для локальной нейросети: какой ПК собрать под какую задачу, по измерениям

> Гайды по железу для локальных нейросетей — это спеклисты, продавцы в роли обозревателей и партнёрские подборки. Здесь иначе: сначала ворклоад, потом коробка, каждая цифра измерена на нашем железе, а неизмеренные дорожки названы пробелами.

- Published: 2026-08-21
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/local-llm-homelab-hardware/

Коротко: сначала выбирают ворклоад, потом коробку. Личный ассистент,
домашний сервер на небольшую команду и стенд под миллион токенов — три
разные покупки, и решающая цифра у каждой своя. Ниже то, что наше железо
измеримо сделало на каждом ворклоаде, и, что не менее важно, те ворклоады,
по которым у нас данных нет и мы отказываемся их выдумывать.

## Почему подборки железа для локальных нейросетей так плохи

Любой запрос вида «какой ПК собрать для нейросетей» выдаёт страницы одной
конструкции: таблица видеокарт по объёму VRAM, абзац арифметики памяти,
рекомендация. Ищешь измерение под рекомендацией — обычно его нет. Вендоры
ранжируются в собственных категориях: в топе по мини-ПК регулярно стоят
продавцы мини-ПК, обозревающие сами себя. Партнёрские подборки цитируют
темп генерации, который через несколько пересказов сводится к двум-трём
первоисточникам, растерявшим по дороге модель, квант, длину контекста и
рантайм. Эта потеря и есть вся проблема:
[цифра бенчмарка — это конфиг под прикрытием](https://agmind.ai/ru/essays/benchmark-number-config-in-disguise/),
а цифра без конфига о покупке не говорит ничего.

Эта страница скромнее по охвату и, как нам кажется, полезнее: что два класса железа,
которыми мы владеем, реально сделали на замороженных ворклоадах, с каждой
цифрой, ведущей на свои сырые прогоны.

## Начинать надо с ворклоада, а не с коробки

Почти любой выбор железа под локальный AI решают четыре вопроса. Ответьте
на них до того, как откроете первую спецификацию.

**Сколько людей?** Ассистент одного человека и команда из пяти — разные
машины, и дело не в скорости как таковой, а в том, как растёт ожидание под
конкурентностью.

**Какой длины промпты?** Чат и «вставь документ на пятьдесят страниц»
нагружают машину в разных местах. Второй упирается в префилл, который ведёт
себя совсем не как генерация.

**Насколько велика модель на самом деле?** Не число параметров — класс. MoE
класса 35B и модель на 284B живут по разные стороны границы, которую
никакой объём unified-памяти в одной коробке не переходит.

**Работает ли она целый день?** Коробка, быстрая десять минут, и коробка,
держащая темп восемь часов, — разные продукты, и в спецификациях эта
разница не появляется.

## Сколько памяти нужно локальной нейросети: что делает мини-ПК на 128 ГБ

Наша рабочая лошадка: машина на Ryzen AI Max+ 395 со 128 ГБ unified-памяти,
llama.cpp запинен по digest образа, обслуживает MoE класса 35B. Всё ниже
измерено на замороженных ворклоадах, отказы оставлены в знаменателе.

**Личный ассистент.** Первый токен ответа за
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)), декод идёт
на **15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) — ниже порога,
на котором человек замечает ожидание, и быстрее темпа чтения. Для одного
пользователя на повседневных задачах этот класс коробок перестал быть узким
местом.

**Небольшая команда.** На четырёх одновременных чатах медианное ожидание
первого слова — **338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)),
на восьми — **865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)),
а завершаемость держится на
**100.0 % of requests** ([strix.qwen36.interactive2.c8.completion-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.completion-nothink/)).
[Вся лестница](https://agmind.ai/ru/reports/concurrency-capacity-strix-halo/) — это способ
считать ёмкость честно: выбираете ожидание, которое ваши люди терпят, и идёте по таблице в обратную сторону.

**Длинные документы.** Первый вопрос по документу в 32k токенов стоит
**33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)) — это счёт за префилл; если берёте коробку под документные процессы, смотрите на него, а не на скорость декода. Останьтесь в сессии, и кеш промпта вернёт следующий
вопрос за
**860 ms** ([strix.qwen36.docsession.c1.ttft-q2-32k-cache](https://agmind.ai/claims/strix.qwen36.docsession.c1.ttft-q2-32k-cache/));
[механика и единственное условие, которое ей нужно](https://agmind.ai/ru/reports/llamacpp-prompt-cache-strix-halo/),
значат здесь больше железа.

**Целый день.** Три непрерывных часа на конкурентности четыре сдвинули темп
декода на **1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/)), и
так на двух коммерчески одинаковых юнитах.
[Отчёт о длительной нагрузке](https://agmind.ai/ru/reports/strix-halo-sustained-load-3-hours/)
отвечает на вопрос «уйдёт ли мини-ПК в троттлинг, если оставить его
обслуживать».

**Автоматизация.** Задачи со строгим JSON выполнялись на
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/)) — и
[переменной надёжности оказалась модель, а не настройки](https://agmind.ai/ru/reports/local-llm-json-reliability/).

Что этот класс памяти запускает вообще —
[отдельная страница](https://agmind.ai/ru/reports/what-128gb-unified-memory-runs/); полные
измеренные таблицы лежат в
[репозитории бенчмарков](https://github.com/botAGI/strix-halo-llm-benchmarks).

## Что делает пара DGX Spark

Второй класс, которым мы владеем: два юнита GB10, соединённых линком 200G,
обслуживают MoE на 284B параметров через vLLM. Это ответ на конкретный
вопрос — запустить фронтирный открытый класс под собственной крышей, — и
идёт он в комплекте с эксплуатационным домашним заданием:
[флаг выбора ядер, который автоматический режим пропускает](https://agmind.ai/ru/reports/dsv4-flash-moe-backend-dgx-spark/),
[штатный мониторинг GPU, работающий наполовину](https://agmind.ai/ru/reports/dgx-spark-gpu-monitoring/),
и [кривая контекста до миллиона токенов](https://agmind.ai/ru/reports/dspark-speculative-1m-dgx-spark/),
первое заполнение которой — событие, которое планируют, а не запрос,
который просто отправляют. Измеренный ответ покупателю, включая то, кому её
брать не стоит, — [отдельная страница](https://agmind.ai/ru/reports/dgx-spark-worth-it/);
сравнение в две колонки с коробкой Strix —
[здесь](https://agmind.ai/ru/reports/strix-halo-vs-dgx-spark/).

## Какая коробка под какой ворклоад

Читаем собственные измерения как решение:

- **Один человек, чат и помощь с кодом** — класс 128 ГБ unified делает это
  с запасом. Дальнейшие решения весят больше самой коробки:
  [квантование](https://agmind.ai/ru/reports/q8-0-vs-q4-k-m-strix-halo/) и
  [бэкенд](https://agmind.ai/ru/compare/llamacpp-vulkan-vs-rocm-strix-halo/) сдвинули наши
  цифры сильнее, чем сдвинул бы типичный план апгрейда.
- **Небольшая команда на чат-подобной работе** — тот же класс; размер берут
  с лестницы конкурентности, а не по числу сотрудников.
- **Работа с документами** — снова тот же класс, но планировать надо вокруг
  префилла, а не декода, и относиться к переиспользованию сессии как к оптимизации на уровне железа.
- **Фронтирный открытый класс** — одна коробка его не делает. Пара сделала,
  со швами, и мы опубликовали и рецепт, и ловушки.
- **Однопоточная работа, критичная к задержке, на тяжёлых промптах** — сначала
  прочитайте цифры префилла выше, потом покупайте; именно здесь локальное
  железо разочаровывает людей чаще всего.

## Мини-ПК или сборка с видеокартой: чего мы НЕ измеряли

Это раздел, который остальные гайды по железу опускают, и поэтому наш
короток там, где их гайды уверенны.

**Сборки с дискретной видеокартой.** Одна и две карты класса RTX, вопрос
про б/у 3090, вопрос про 5090 — они доминируют в выдаче, и первичных данных
по ним у нас нет. На [наших стендах](https://agmind.ai/ru/testbed/) дорожка CUDA заявлена,
опубликованных прогонов по ней нет, значит и утверждений мы не делаем.
Появятся прогоны — придут с сырыми данными, как всё остальное.

**Apple Silicon.** Дорожка заявлена, опубликованных прогонов ноль,
утверждений ноль.

**Только CPU и выгрузка при малом VRAM.** Режим «модель не влезает» — самый
спрашиваемый и наименее измеренный вопрос ниже этого класса железа. Мы его
не гоняли.

**Ватты и деньги.** Цен мы не публикуем: цены на железо гуляют, а лаборатория, которая их цитирует, плохо стареет. Ватты на токен — реальный
пробел, и мы собираемся его закрыть, когда устоится методика замера; до тех
пор цифр по электричеству у нас тоже нет.

Если гайд уверенно закрывает всё это разом, проверьте, измерял ли он хоть
что-нибудь из списка.

## Как покупать, не доверяя никому, включая нас

Определите ворклоад, а дальше требуйте от любой прочитанной цифры: какое
устройство и прошивка, какая сборка рантайма, какой артефакт модели и
квант, какой промпт и длина ответа, какая конкурентность, с какой стороны
провода снято, сколько повторов.
[Протокол описан здесь](https://agmind.ai/ru/reports/how-to-benchmark-local-llm/), а
[харнесс открыт](https://github.com/botAGI/agmind-bench) — замороженные
ворклоады, которые гоняем мы, вы можете прогнать на коробке до покупки или
после.

Частые вопросы с однострочными измеренными ответами собраны на
[странице ответов](https://agmind.ai/ru/answers/); у каждой цифры выше есть постоянная
страница со скоупом, ограничениями и сырыми доказательствами в
[реестре клеймов](https://agmind.ai/ru/claims/).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
