# Спекулятивный DSpark на двух DGX Spark: кривая глубины до миллиона токенов

> Наш fp8-запуск DSpark на GB10, независимая репродукция комьюнити-сборки NVFP4 и данные глубины, которых никто не публиковал: одиночная кривая до реального миллионного промпта — плюс два негативных результата, названные своими именами.

- Published: 2026-08-05
- Evidence level: lab_single_run
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/dspark-speculative-1m-dgx-spark/

> **Заметка о рамках.** Исследование шло на паре DGX Spark лаборатории с
> собственным бенч-набором репозитория — честная пропускная способность как
> `completion_tokens / wall_time`, без стриминга (подсчёт по SSE-событиям
> сильно занижает реальные токены — именно поэтому метод зафиксирован).
> В реестр клеймов за карточками это не входит: цифры ниже цитируются из
> опубликованного репозитория, где рядом лежат сырые чекпойнты.

## Два рецепта, честно атрибутированные

Спекулятивный DSpark от DeepSeek обслуживает DeepSeek-V4-Flash на двух
узлах DGX Spark (GB10, sm_121), TP=2 через 200G RoCE, с настроенным окном
в миллион токенов. В репозитории две линии, и явно сказано, чья какая:
**fp8-запуск DSpark — наш**: draft-голова и proposer, вшитые в vLLM
патчами, плюс численные фиксы, которые довели драфт от «предсказывает шум»
до «совпадает с эталоном». **Более быстрая линия NVFP4-KV — рецепт
tonyd2wild**: мы воспроизвели её бит-в-бит на своём кластере и измерили; мы
её не авторили и не заявляем выигрыша в скорости — наша репродукция его
бенчмарка конкуренции попадает в его собственный разброс между прогонами.

## Кривая глубины, которой не было

У сообщества были точки на отдельных глубинах; не хватало кривой. На сборке NVFP4 одиночный декод идёт 42.7 tok/s на контексте 16K, 17.6 на 512K и 17.2 на реальном промпте в 1 032 953 токена — после 512K кривая выходит на полку, а не обваливается.
На полной глубине холодный префилл занимает около 642 секунд; с тёплым префикс-кэшем тот же запрос стартует примерно за 4 секунды.
Настроенное миллионное окно на потребительском кремнии реально — если
планировать счёт за префилл и знать пол декода, на котором придётся жить.

## Почему скорость ведёт себя так

Механизм — acceptance, а не bandwidth: с выключенной спекуляцией обе KV-сборки декодят практически одинаково, ~26.6 tok/s — линия NVFP4 выигрывает тем, что удерживает больше принятых спекулятивных токенов за шаг, а спад acceptance по позициям и тянет кривую вниз.
Конкуренция — где коробка отрабатывает своё: наша fp8-линия держит ~99 tok/s агрегата на 8 потоках и 141–146 tok/s на 12, а одиночная спекуляция даёт +21–24% против no-spec.

## Два негативных результата, опубликованные как результаты

- **Ни одна конфигурация сэмплера надёжно не чинит когерентность на
  глубине** на этой сборке: коллапс — не фиксированный порог глубины, а
  `min_p` попросту заблокирован под spec-decode. Проба лежит в репозитории
  полноценным бенч-файлом, а не сноской.
- **Наши попытки улучшить воспроизведённую сборку не выиграли**: честное
  резюме в репозитории говорит это теми же словами, с ничьёй, показанной
  против собственного разброса автора.

## Почему это место в записях лаборатории

Это и есть позиция, которую лаборатория продаёт, применённая к себе:
воспроизведи чужой результат прежде чем с ним сравниваться, опубликуй
кривую с сырыми чекпойнтами, укажи линейку, положи провалы рядом с
победами. Линия DGX Spark всё ещё без ячеек методологии v1 — это остаётся
запланированным шагом, — но кривая глубины, механизм acceptance и оба
негатива цитируемы из репозитория уже сегодня.

## Доказательства

Рецепты, патчи, бенч-чекпойнты и сырые выводы:
[DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8](https://github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8).
Апстрим-рецепт NVFP4-KV: tonyd2wild (кредит в репозитории). Связанные
материалы лаборатории: [находка про MoE-ядро](https://agmind.ai/ru/reports/dsv4-flash-moe-backend-dgx-spark/)
на той же паре и раннее [исследование 1M-сервинга](https://agmind.ai/ru/reports/dspark-dgx-spark-1m-legacy/).
Лонгриды: [часть 5](https://habr.com/ru/articles/1050470/) и
[исследование 0731](https://habr.com/ru/articles/1066164/) на Хабре.

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
