# DeepSeek-V4-Flash DSpark на 2× DGX Spark: контекст 1M — legacy-результаты

> Bring-up спекулятивного декодирования DSpark на GB10 (sm_121) через 200G RoCE, кривая глубины до миллиона токенов, независимое воспроизведение комьюнити-сборки и два честных отрицательных результата.

- Published: 2026-07-31
- Evidence level: legacy
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/dspark-dgx-spark-1m-legacy/

> **Уровень доказательств: `legacy`.** Замерено на собственном кластере из двух
> DGX Spark до методологии v1 — «яблоки с яблоками» внутри репо
> (completion_tokens / wall_time, без стриминга), но без пререгистрации.
> Цифры — цитаты из публичного репозитория, не из claim registry лаборатории.

**Источник (патчи, лаунчеры, бенчмарк-чекпоинты, сырые данные):**
[github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8](https://github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8) (MIT)
· Развёрнутые рассказы: [порт и баг в одну строку](https://habr.com/ru/articles/1055792/), [multi-user serving](https://habr.com/ru/articles/1050470/)

## Что это за работа

Две вещи, с раздельной атрибуцией (полная цепочка — в CREDITS репозитория):

1. **Наш собственный bring-up fp8 DSpark на GB10/sm_121** — драфт-голова и
   proposer DSpark, вшитые в spec-decode-цикл vLLM патчами (без форка базовой
   модели), TP=2 через два DGX Spark по 200G RoCEv2, на контексте в миллион
   токенов. Включая численные баг-фиксы, которые довели драфт от «предсказывает
   шум» до «совпадает с эталоном».
2. **Независимое воспроизведение и расширенный замер NVFP4-KV-сборки
   tonyd2wild** — явно не наше авторство; воспроизведено байт-в-байт и
   измерено глубже, чем было опубликовано где-либо.

## Исторические результаты (цитаты из репо)

- **fp8 DSpark (наш):** выигрыш одного потока +21–24% против без-spec; под конкурентностью ~99 tok/s на 8 потоках и 141–146 tok/s на 12 (прод-настройки).
- **Кривая глубины до 1M (сборка NVFP4, наш замер):** 42.7 tok/s на 16K → 17.6 на 512K → 17.2 на реальном промпте в 1.03M токенов — кривая выполаживается после 512K. Приложены тайминги холодного префилла и префикс-кэша на полной глубине.
- **Воспроизведение:** число автора комьюнити-сборки на конкурентности 16
  воспроизвелось на нашем кластере в пределах его же разброса между прогонами —
  его бенчмарк подтверждён, превосходства над ним не заявляется.

## Два честных отрицательных результата

1. **Ни одна конфигурация сэмплера надёжно не чинит когерентность на длинном
   контексте** на измеренной сборке: коллапс — не фиксированный порог глубины,
   а одна из популярных «ручек» просто заблокирована под spec-decode.
2. **Кривую глубины двигает попозиционный спад acceptance, а не пропускная
   способность** — с опубликованным разбором вместо истории про «загадочное
   замедление».

## Почему это важно для лаборатории

Этот репозиторий — доказательство глубокого bring-up на нестандартном железе
(aarch64 + sm_121 — ровно та территория, где «поддерживается» и «работает» —
разные слова), рабочий паттерн независимого воспроизведения с чистым
разделением заслуг, и источник дизайна workload'ов long-context и
спекулятивного декодирования, которые теперь в библиотеке лаборатории.

## Чего эти данные не устанавливают

Ни обобщения на датацентровый Blackwell, ни квалификации качества модели,
ни внешнего воспроизведения именно *нашей* fp8-линии (пока).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
