Заметка о рамках. Это исследование шло на паре DGX Spark лаборатории с собственным пиненным харнессом — digest образа, ревизия модели и формулы метрик в run-манифесте репозитория, сырые выводы в
results/raw/. Оно пока не входит в реестр клеймов, стоящий за нашими карточками: цифры ниже цитируются из опубликованного репозитория, где их можно сверить с сырыми записями.
Находка
DeepSeek-V4-Flash-0731 — MoE на 284B параметров с ~13B активных — обслуживается на двух узлах DGX Spark (GB10) по RoCE с тензорным параллелизмом.
Образ runtime содержит FlashInfer MoE-ядро, собранное специально под
нативных MXFP4-экспертов этого семейства моделей на этом поколении GPU.
Автовыбор бэкенда (auto) его не выбирает.
Принудительный выбор вручную (--moe-backend flashinfer_b12x) стоит +13.3% по среднему и +16.6% по медиане на клиентской метрике декода в однопоточном контроле — в серии есть один выброс, поэтому репозиторий приводит обе статистики.
Проверка, что флаг реально сработал, — одна строка лога: сервер должен
отчитаться о бэкенде B12X, а не о DEEPGEMM-фолбэке. Без этой проверки флаг
может молча не сделать ничего.
Почему это место в квалификационной лаборатории
Дефолт — не вердикт. Ядро есть в образе, оно быстрее ровно на этой связке модель-на-этом-кремнии и исключено из автоматического выбора — а значит, каждое развёртывание этой пары «из коробки» оставляет двузначные проценты декода на столе без единой ошибки, предупреждения или видимого признака. Единственный способ узнать — измерить конфигурацию, которую реально запускаешь, и прочитать логи, чтобы подтвердить, что runtime реально сделал. Это весь аргумент лаборатории в одном инциденте.
Что даёт репозиторий
Скрипт двухузлового запуска head-first с задокументированными ловушками фабрики (peer не должен подключаться раньше, чем store головного узла начнёт слушать), бенчмарк-харнесс с двумя профилями нагрузки и режимом чистого декода, который меряет и исключает TTFT, пиненный digest образа и ревизию модели, и сырые выводы бенчмарков. Замерялся community-квантованный FP8-дериватив, пиненный ревизией; официальный aligned-чекпоинт указан, но не замерялся — репозиторий говорит это явно, и мы тоже.
Чего это не устанавливает
Пока никаких цифр в реестре клеймов: линия DGX Spark ещё не прошла методологию v1 (замороженные корпуса, пакеты доказательств, выводимые клеймы) — это запланированный следующий шаг для этого стенда. Один проход на конфигурацию. Никаких сравнений с другими устройствами, и ничто отсюда не переносится на официальный чекпоинт, другие размеры моделей или будущие версии образа.
Доказательства
Лонгрид-версия этого исследования — на Хабре: DeepSeek 0731 на DGX Spark. Рецепт, манифест и сырые выводы: github.com/botAGI/dspark-0731-gb10. Наш измерительный харнесс для квалификационных линий: agmind-bench.