Отчёт

DeepSeek-V4-Flash DSpark на 2× DGX Spark: контекст 1M — legacy-результаты

Bring-up спекулятивного декодирования DSpark на GB10 (sm_121) через 200G RoCE, кривая глубины до миллиона токенов, независимое воспроизведение комьюнити-сборки и два честных отрицательных результата.

legacy internal research 31 июля 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Уровень доказательств: legacy. Замерено на собственном кластере из двух DGX Spark до методологии v1 — «яблоки с яблоками» внутри репо (completion_tokens / wall_time, без стриминга), но без пререгистрации. Цифры — цитаты из публичного репозитория, не из claim registry лаборатории.

Источник (патчи, лаунчеры, бенчмарк-чекпоинты, сырые данные): github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8 (MIT) · Развёрнутые рассказы: порт и баг в одну строку, multi-user serving

Что это за работа

Две вещи, с раздельной атрибуцией (полная цепочка — в CREDITS репозитория):

  1. Наш собственный bring-up fp8 DSpark на GB10/sm_121 — драфт-голова и proposer DSpark, вшитые в spec-decode-цикл vLLM патчами (без форка базовой модели), TP=2 через два DGX Spark по 200G RoCEv2, на контексте в миллион токенов. Включая численные баг-фиксы, которые довели драфт от «предсказывает шум» до «совпадает с эталоном».
  2. Независимое воспроизведение и расширенный замер NVFP4-KV-сборки tonyd2wild — явно не наше авторство; воспроизведено байт-в-байт и измерено глубже, чем было опубликовано где-либо.

Исторические результаты (цитаты из репо)

Два честных отрицательных результата

  1. Ни одна конфигурация сэмплера надёжно не чинит когерентность на длинном контексте на измеренной сборке: коллапс — не фиксированный порог глубины, а одна из популярных «ручек» просто заблокирована под spec-decode.
  2. Кривую глубины двигает попозиционный спад acceptance, а не пропускная способность — с опубликованным разбором вместо истории про «загадочное замедление».

Почему это важно для лаборатории

Этот репозиторий — доказательство глубокого bring-up на нестандартном железе (aarch64 + sm_121 — ровно та территория, где «поддерживается» и «работает» — разные слова), рабочий паттерн независимого воспроизведения с чистым разделением заслуг, и источник дизайна workload’ов long-context и спекулятивного декодирования, которые теперь в библиотеке лаборатории.

Чего эти данные не устанавливают

Ни обобщения на датацентровый Blackwell, ни квалификации качества модели, ни внешнего воспроизведения именно нашей fp8-линии (пока).

Как цитировать

AGmind Systems Lab (2026-07-31). DeepSeek-V4-Flash DSpark на 2× DGX Spark: контекст 1M — legacy-результаты. Evidence level: legacy. https://agmind.ai/ru/reports/dspark-dgx-spark-1m-legacy/
← Отчёты