Отчёт

vLLM auto выбрал не то MoE-ядро для DeepSeek-V4-Flash на GB10

DeepSeek-V4-Flash-0731 на двух узлах DGX Spark: образ содержит MoE-ядро под MXFP4-экспертов этой модели на этом кремнии — а автовыбор его пропускает. Ручной выбор стоит двузначных процентов декода. Рецепт и сырые результаты открыты.

lab_single_run internal research 3 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Заметка о рамках. Это исследование шло на паре DGX Spark лаборатории с собственным пиненным харнессом — digest образа, ревизия модели и формулы метрик в run-манифесте репозитория, сырые выводы в results/raw/. Оно пока не входит в реестр клеймов, стоящий за нашими карточками: цифры ниже цитируются из опубликованного репозитория, где их можно сверить с сырыми записями.

Находка

DeepSeek-V4-Flash-0731 — MoE на 284B параметров с ~13B активных — обслуживается на двух узлах DGX Spark (GB10) по RoCE с тензорным параллелизмом. Образ runtime содержит FlashInfer MoE-ядро, собранное специально под нативных MXFP4-экспертов этого семейства моделей на этом поколении GPU. Автовыбор бэкенда (auto) его не выбирает.

Принудительный выбор вручную (--moe-backend flashinfer_b12x) стоит +13.3% по среднему и +16.6% по медиане на клиентской метрике декода в однопоточном контроле — в серии есть один выброс, поэтому репозиторий приводит обе статистики. Проверка, что флаг реально сработал, — одна строка лога: сервер должен отчитаться о бэкенде B12X, а не о DEEPGEMM-фолбэке. Без этой проверки флаг может молча не сделать ничего.

Почему это место в квалификационной лаборатории

Дефолт — не вердикт. Ядро есть в образе, оно быстрее ровно на этой связке модель-на-этом-кремнии и исключено из автоматического выбора — а значит, каждое развёртывание этой пары «из коробки» оставляет двузначные проценты декода на столе без единой ошибки, предупреждения или видимого признака. Единственный способ узнать — измерить конфигурацию, которую реально запускаешь, и прочитать логи, чтобы подтвердить, что runtime реально сделал. Это весь аргумент лаборатории в одном инциденте.

Что даёт репозиторий

Скрипт двухузлового запуска head-first с задокументированными ловушками фабрики (peer не должен подключаться раньше, чем store головного узла начнёт слушать), бенчмарк-харнесс с двумя профилями нагрузки и режимом чистого декода, который меряет и исключает TTFT, пиненный digest образа и ревизию модели, и сырые выводы бенчмарков. Замерялся community-квантованный FP8-дериватив, пиненный ревизией; официальный aligned-чекпоинт указан, но не замерялся — репозиторий говорит это явно, и мы тоже.

Чего это не устанавливает

Пока никаких цифр в реестре клеймов: линия DGX Spark ещё не прошла методологию v1 (замороженные корпуса, пакеты доказательств, выводимые клеймы) — это запланированный следующий шаг для этого стенда. Один проход на конфигурацию. Никаких сравнений с другими устройствами, и ничто отсюда не переносится на официальный чекпоинт, другие размеры моделей или будущие версии образа.

Доказательства

Лонгрид-версия этого исследования — на Хабре: DeepSeek 0731 на DGX Spark. Рецепт, манифест и сырые выводы: github.com/botAGI/dspark-0731-gb10. Наш измерительный харнесс для квалификационных линий: agmind-bench.

Как цитировать

AGmind Systems Lab (2026-08-03). vLLM auto выбрал не то MoE-ядро для DeepSeek-V4-Flash на GB10. Evidence level: lab_single_run. https://agmind.ai/ru/reports/dsv4-flash-moe-backend-dgx-spark/
← Отчёты