Спросите веб, стоит ли брать DGX Spark под локальные LLM, — получите
спеки: 128 ГБ unified, петафлопс разреженного FP4, ConnectX-7. Чего вы
почти никогда не получите — что эта коробка реально сделала под живой
нагрузкой. У нас пара, сырые прогоны опубликованы, и эта страница отвечает
на покупательский вопрос только измеренным — с явными ограничениями:
DGX-линия у нас bring-up (lab_single_run), не трёхповторная методология.
Что пара Spark’ов реально сделала
Всё ниже — цитаты из наших публичных репозиториев прогонов, воспроизводимо по рецептам в них.
Обслужила 284B-параметровый MoE дома. DeepSeek-V4-Flash-0731 (284B всего, ~13B активных), tensor-parallel через два узла по 200G RoCE
. Одиночный клиентский декод на финальной конфигурации:67.6 tok/s на коротком card-профиле, 43.7 tok/s на тяжёлом профиле с 4K-контекстом . Этот разброс по профилям — а не железо — главная причина, почему опубликованные цифры Spark’а друг с другом не сходятся; полное примирение — отдельная страница.
Сложилась в агрегат для группы. На 12 одновременных потоках та же конфигурация дала 260.4 tok/s агрегата на code-профиле ; в более ранней 1M-сборке 8 потоков держали ~99 tok/s, а 12 — 141–146 tok/s . Агрегат — серверная цифра, не ощущение: поделите на вашу конкурентность, прежде чем представлять себе чат.
Прошла кривую контекста до миллиона токенов — и честно про неё рассказала. Декод: 42.7 tok/s на глубине 16K, 17.6 на 512K, 17.2 на 1.03M — плато после полумиллиона, что по-настоящему примечательно. Счёт приходит в другом месте: первое заполнение 1M-контекста стоило 642 секунды холодным и 4 секунды тёплым . Окно в миллион токенов, которое вы можете позволить себе заполнить один раз, — другой продукт, чем то, которое заполняется на каждый запрос.
Один флаг значил больше любого тюнинга. Рантайм везёт MoE-ядро под
MXFP4-экспертов этой модели и исключает его из автовыбора:
--moe-backend flashinfer_b12x сдвинул одиночный декод с 59.7 до
67.6 tok/s на клиенте , движковый замер даёт 9–12% по частоте
шагов верификации . Разбор — в
отчёте про бэкенд, проверка,
что флаг реально взялся, — на странице рецепта.
Кому пара подходит
- Хотите крупнейший класс открытых MoE под собственной крышей. Два Spark’а это сделали — достаточно стабильно, чтобы опубликовать прогоны. Ничто другое в нашем парке при такой мощности и настольном форм-факторе этого не сделало.
- Обслуживаете небольшую группу, а не одного нетерпеливого. Агрегатные цифры настоящие; попоточные на высокой конкурентности — скромные.
- Занимаетесь long-context исследованиями. Плато по глубине — находка, ради которой стоит владеть железом, если ваши сессии переиспользуют префикс и 642-секундный холодный префилл амортизируется.
Кому не брать
- Одиночная, чувствительная к задержке работа на тяжёлых промптах. 43.7 tok/s на тяжёлом профиле — рабоче, но не бодро, и каждый свежий длинный документ платит префилл целиком.
- Ожидающим поведение датацентрового Blackwell. Наша страница стендов говорит прямо: результаты GB10 вверх не обобщаются.
- Не готовым её эксплуатировать. Bring-up был настоящей работой —
однострочный баг порта съел дни (сага),
а штатный GPU-мониторинг работает наполовину: на unified memory GB10
dcgm-exporterне работает совсем, NVML отдаёт N/A на заметную долю запросов; мы в итоге парсимnvidia-smiсобственным textfile-коллектором (разбор на Habr).
Ограничения этого ответа
Одна пара юнитов, одно семейство моделей в центре, одиночные проходы с
прогревами вместо трёхповторной дисциплины — уровень lab_single_run, и
метка означает то, что означает. Советов по цене нет: цены на железо
двигаются, лаборатория их не публикует. Когда линия methodology-v1 дойдёт
до Spark’ов, цифры этой страницы будут заменены клеймами с доверительными
интервалами — подпишитесь на /ru/subscribe/, если вам
нужно это событие, а не этот снимок.
Сырые прогоны, манифесты и рецепт: botAGI/dspark-0731-gb10 и 1M-context репозиторий.