Уровень доказательств:
legacy. Замерено на собственном кластере из двух DGX Spark до методологии v1 — «яблоки с яблоками» внутри репо (completion_tokens / wall_time, без стриминга), но без пререгистрации. Цифры — цитаты из публичного репозитория, не из claim registry лаборатории.
Источник (патчи, лаунчеры, бенчмарк-чекпоинты, сырые данные): github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8 (MIT) · Развёрнутые рассказы: порт и баг в одну строку, multi-user serving
Что это за работа
Две вещи, с раздельной атрибуцией (полная цепочка — в CREDITS репозитория):
- Наш собственный bring-up fp8 DSpark на GB10/sm_121 — драфт-голова и proposer DSpark, вшитые в spec-decode-цикл vLLM патчами (без форка базовой модели), TP=2 через два DGX Spark по 200G RoCEv2, на контексте в миллион токенов. Включая численные баг-фиксы, которые довели драфт от «предсказывает шум» до «совпадает с эталоном».
- Независимое воспроизведение и расширенный замер NVFP4-KV-сборки tonyd2wild — явно не наше авторство; воспроизведено байт-в-байт и измерено глубже, чем было опубликовано где-либо.
Исторические результаты (цитаты из репо)
- fp8 DSpark (наш): выигрыш одного потока +21–24% против без-spec; под конкурентностью ~99 tok/s на 8 потоках и 141–146 tok/s на 12 (прод-настройки).
- Кривая глубины до 1M (сборка NVFP4, наш замер): 42.7 tok/s на 16K → 17.6 на 512K → 17.2 на реальном промпте в 1.03M токенов — кривая выполаживается после 512K. Приложены тайминги холодного префилла и префикс-кэша на полной глубине.
- Воспроизведение: число автора комьюнити-сборки на конкурентности 16 воспроизвелось на нашем кластере в пределах его же разброса между прогонами — его бенчмарк подтверждён, превосходства над ним не заявляется.
Два честных отрицательных результата
- Ни одна конфигурация сэмплера надёжно не чинит когерентность на длинном контексте на измеренной сборке: коллапс — не фиксированный порог глубины, а одна из популярных «ручек» просто заблокирована под spec-decode.
- Кривую глубины двигает попозиционный спад acceptance, а не пропускная способность — с опубликованным разбором вместо истории про «загадочное замедление».
Почему это важно для лаборатории
Этот репозиторий — доказательство глубокого bring-up на нестандартном железе (aarch64 + sm_121 — ровно та территория, где «поддерживается» и «работает» — разные слова), рабочий паттерн независимого воспроизведения с чистым разделением заслуг, и источник дизайна workload’ов long-context и спекулятивного декодирования, которые теперь в библиотеке лаборатории.
Чего эти данные не устанавливают
Ни обобщения на датацентровый Blackwell, ни квалификации качества модели, ни внешнего воспроизведения именно нашей fp8-линии (пока).