# vLLM auto выбрал не то MoE-ядро для DeepSeek-V4-Flash на GB10

> DeepSeek-V4-Flash-0731 на двух узлах DGX Spark: образ содержит MoE-ядро под MXFP4-экспертов этой модели на этом кремнии — а автовыбор его пропускает. Ручной выбор стоит двузначных процентов декода. Рецепт и сырые результаты открыты.

- Published: 2026-08-03
- Evidence level: lab_single_run
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/dsv4-flash-moe-backend-dgx-spark/

> **Заметка о рамках.** Это исследование шло на паре DGX Spark лаборатории с
> собственным пиненным харнессом — digest образа, ревизия модели и формулы
> метрик в run-манифесте репозитория, сырые выводы в `results/raw/`. Оно
> пока не входит в реестр клеймов, стоящий за нашими карточками: цифры ниже
> цитируются из опубликованного репозитория, где их можно сверить с сырыми
> записями.

## Находка

DeepSeek-V4-Flash-0731 — MoE на 284B параметров с ~13B активных — обслуживается на двух узлах DGX Spark (GB10) по RoCE с тензорным параллелизмом.
Образ runtime содержит FlashInfer MoE-ядро, собранное специально под
нативных MXFP4-экспертов этого семейства моделей на этом поколении GPU.
Автовыбор бэкенда (`auto`) его **не выбирает**.

Принудительный выбор вручную (`--moe-backend flashinfer_b12x`) стоит +13.3% по среднему и +16.6% по медиане на клиентской метрике декода в однопоточном контроле — в серии есть один выброс, поэтому репозиторий приводит обе статистики.
Проверка, что флаг реально сработал, — одна строка лога: сервер должен
отчитаться о бэкенде B12X, а не о DEEPGEMM-фолбэке. Без этой проверки флаг
может молча не сделать ничего.

## Почему это место в квалификационной лаборатории

Дефолт — не вердикт. Ядро есть в образе, оно быстрее ровно на этой связке
модель-на-этом-кремнии и исключено из автоматического выбора — а значит,
каждое развёртывание этой пары «из коробки» оставляет двузначные проценты
декода на столе без единой ошибки, предупреждения или видимого признака.
Единственный способ узнать — измерить конфигурацию, которую реально
запускаешь, и прочитать логи, чтобы подтвердить, что runtime реально
сделал. Это весь аргумент лаборатории в одном инциденте.

## Что даёт репозиторий

Скрипт двухузлового запуска head-first с задокументированными ловушками
фабрики (peer не должен подключаться раньше, чем store головного узла начнёт
слушать), бенчмарк-харнесс с двумя профилями нагрузки и режимом чистого
декода, который меряет и исключает TTFT, пиненный digest образа и ревизию
модели, и сырые выводы бенчмарков. Замерялся community-квантованный
FP8-дериватив, пиненный ревизией; официальный aligned-чекпоинт указан, но не
замерялся — репозиторий говорит это явно, и мы тоже.

## Чего это не устанавливает

Пока никаких цифр в реестре клеймов: линия DGX Spark ещё не прошла
методологию v1 (замороженные корпуса, пакеты доказательств, выводимые
клеймы) — это запланированный следующий шаг для этого стенда. Один проход на
конфигурацию. Никаких сравнений с другими устройствами, и ничто отсюда не
переносится на официальный чекпоинт, другие размеры моделей или будущие
версии образа.

## Доказательства

Лонгрид-версия этого исследования — на Хабре:
[DeepSeek 0731 на DGX Spark](https://habr.com/ru/articles/1066164/).
Рецепт, манифест и сырые выводы:
[github.com/botAGI/dspark-0731-gb10](https://github.com/botAGI/dspark-0731-gb10).
Наш измерительный харнесс для квалификационных линий:
[agmind-bench](https://github.com/botAGI/agmind-bench).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
