# Стоит ли DGX Spark своих денег под локальные LLM? Измеренный ответ

> Самый частый покупательский вопрос ниши закрыт почти исключительно спековой арифметикой. Вот что пара GB10 реально сделала в нашей лаборатории — 284B MoE, кривая контекста до миллиона токенов — и кому её брать, а кому нет.

- Published: 2026-08-16
- Evidence level: lab_single_run
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/dgx-spark-worth-it/

Спросите веб, стоит ли брать DGX Spark под локальные LLM, — получите
спеки: 128 ГБ unified, петафлопс разреженного FP4, ConnectX-7. Чего вы
почти никогда не получите — что эта коробка реально *сделала* под живой
нагрузкой. У нас пара, сырые прогоны опубликованы, и эта страница отвечает
на покупательский вопрос только измеренным — с явными ограничениями:
DGX-линия у нас bring-up (`lab_single_run`), не трёхповторная методология.

## Что пара Spark'ов реально сделала

Всё ниже — цитаты из наших публичных репозиториев прогонов,
воспроизводимо по рецептам в них.

**Обслужила 284B-параметровый MoE дома.** DeepSeek-V4-Flash-0731 (284B
всего, ~13B активных), tensor-parallel через два узла по 200G RoCE
. Одиночный клиентский декод на финальной конфигурации:
67.6 tok/s на коротком card-профиле, 43.7 tok/s на тяжёлом профиле с
4K-контекстом . Этот разброс по профилям — а не железо — главная
причина, почему опубликованные цифры Spark'а друг с другом не сходятся;
полное примирение — [отдельная страница](https://agmind.ai/ru/reports/dspark-speed-numbers-disagree/).

**Сложилась в агрегат для группы.** На 12 одновременных потоках та же
конфигурация дала 260.4 tok/s агрегата на code-профиле ; в более
ранней 1M-сборке 8 потоков держали ~99 tok/s, а 12 — 141–146 tok/s
. Агрегат — серверная цифра, не ощущение: поделите на вашу
конкурентность, прежде чем представлять себе чат.

**Прошла кривую контекста до миллиона токенов — и честно про неё
рассказала.** Декод: 42.7 tok/s на глубине 16K, 17.6 на 512K, 17.2 на
1.03M  — плато после полумиллиона, что по-настоящему
примечательно. Счёт приходит в другом месте: *первое* заполнение
1M-контекста стоило 642 секунды холодным и 4 секунды тёплым .
Окно в миллион токенов, которое вы можете позволить себе заполнить один
раз, — другой продукт, чем то, которое заполняется на каждый запрос.

**Один флаг значил больше любого тюнинга.** Рантайм везёт MoE-ядро под
MXFP4-экспертов этой модели и исключает его из автовыбора:
`--moe-backend flashinfer_b12x` сдвинул одиночный декод с 59.7 до
67.6 tok/s на клиенте , движковый замер даёт 9–12% по частоте
шагов верификации . Разбор — в
[отчёте про бэкенд](https://agmind.ai/ru/reports/dsv4-flash-moe-backend-dgx-spark/), проверка,
что флаг реально взялся, — на [странице рецепта](https://agmind.ai/ru/reports/deepseek-v4-flash-0731-dgx-spark-recipe/).

## Кому пара подходит

- **Хотите крупнейший класс открытых MoE под собственной крышей.** Два
  Spark'а это сделали — достаточно стабильно, чтобы опубликовать прогоны.
  Ничто другое в нашем парке при такой мощности и настольном форм-факторе
  этого не сделало.
- **Обслуживаете небольшую группу, а не одного нетерпеливого.** Агрегатные
  цифры настоящие; попоточные на высокой конкурентности — скромные.
- **Занимаетесь long-context исследованиями.** Плато по глубине — находка,
  ради которой стоит владеть железом, если ваши сессии переиспользуют
  префикс и 642-секундный  холодный префилл амортизируется.

## Кому не брать

- **Одиночная, чувствительная к задержке работа на тяжёлых промптах.**
  43.7 tok/s  на тяжёлом профиле — рабоче, но не бодро, и каждый
  свежий длинный документ платит префилл целиком.
- **Ожидающим поведение датацентрового Blackwell.** Наша
  [страница стендов](https://agmind.ai/ru/testbed/) говорит прямо: результаты GB10 вверх не
  обобщаются.
- **Не готовым её эксплуатировать.** Bring-up был настоящей работой —
  однострочный баг порта съел дни ([сага](https://agmind.ai/ru/reports/dspark-speculative-1m-dgx-spark/)),
  а штатный GPU-мониторинг работает наполовину: на unified memory GB10
  `dcgm-exporter` не работает совсем, NVML отдаёт N/A на заметную долю
  запросов; мы в итоге парсим `nvidia-smi` собственным textfile-коллектором
  ([разбор на Habr](https://habr.com/ru/articles/1030802/)).

## Ограничения этого ответа

Одна пара юнитов, одно семейство моделей в центре, одиночные проходы с
прогревами вместо трёхповторной дисциплины — уровень `lab_single_run`, и
метка означает то, что означает. Советов по цене нет: цены на железо
двигаются, лаборатория их не публикует. Когда линия methodology-v1 дойдёт
до Spark'ов, цифры этой страницы будут заменены клеймами с доверительными
интервалами — подпишитесь на [/ru/subscribe/](https://agmind.ai/ru/subscribe/), если вам
нужно это событие, а не этот снимок.

Сырые прогоны, манифесты и рецепт:
[botAGI/dspark-0731-gb10](https://github.com/botAGI/dspark-0731-gb10) и
[1M-context репозиторий](https://github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
