Заметка о рамках. Исследование шло на паре DGX Spark лаборатории с собственным бенч-набором репозитория — честная пропускная способность как
completion_tokens / wall_time, без стриминга (подсчёт по SSE-событиям сильно занижает реальные токены — именно поэтому метод зафиксирован). В реестр клеймов за карточками это не входит: цифры ниже цитируются из опубликованного репозитория, где рядом лежат сырые чекпойнты.
Два рецепта, честно атрибутированные
Спекулятивный DSpark от DeepSeek обслуживает DeepSeek-V4-Flash на двух узлах DGX Spark (GB10, sm_121), TP=2 через 200G RoCE, с настроенным окном в миллион токенов. В репозитории две линии, и явно сказано, чья какая: fp8-запуск DSpark — наш: draft-голова и proposer, вшитые в vLLM патчами, плюс численные фиксы, которые довели драфт от «предсказывает шум» до «совпадает с эталоном». Более быстрая линия NVFP4-KV — рецепт tonyd2wild: мы воспроизвели её бит-в-бит на своём кластере и измерили; мы её не авторили и не заявляем выигрыша в скорости — наша репродукция его бенчмарка конкуренции попадает в его собственный разброс между прогонами.
Кривая глубины, которой не было
У сообщества были точки на отдельных глубинах; не хватало кривой. На сборке NVFP4 одиночный декод идёт 42.7 tok/s на контексте 16K, 17.6 на 512K и 17.2 на реальном промпте в 1 032 953 токена — после 512K кривая выходит на полку, а не обваливается. На полной глубине холодный префилл занимает около 642 секунд; с тёплым префикс-кэшем тот же запрос стартует примерно за 4 секунды. Настроенное миллионное окно на потребительском кремнии реально — если планировать счёт за префилл и знать пол декода, на котором придётся жить.
Почему скорость ведёт себя так
Механизм — acceptance, а не bandwidth: с выключенной спекуляцией обе KV-сборки декодят практически одинаково, ~26.6 tok/s — линия NVFP4 выигрывает тем, что удерживает больше принятых спекулятивных токенов за шаг, а спад acceptance по позициям и тянет кривую вниз. Конкуренция — где коробка отрабатывает своё: наша fp8-линия держит ~99 tok/s агрегата на 8 потоках и 141–146 tok/s на 12, а одиночная спекуляция даёт +21–24% против no-spec.
Два негативных результата, опубликованные как результаты
- Ни одна конфигурация сэмплера надёжно не чинит когерентность на
глубине на этой сборке: коллапс — не фиксированный порог глубины, а
min_pпопросту заблокирован под spec-decode. Проба лежит в репозитории полноценным бенч-файлом, а не сноской. - Наши попытки улучшить воспроизведённую сборку не выиграли: честное резюме в репозитории говорит это теми же словами, с ничьёй, показанной против собственного разброса автора.
Почему это место в записях лаборатории
Это и есть позиция, которую лаборатория продаёт, применённая к себе: воспроизведи чужой результат прежде чем с ним сравниваться, опубликуй кривую с сырыми чекпойнтами, укажи линейку, положи провалы рядом с победами. Линия DGX Spark всё ещё без ячеек методологии v1 — это остаётся запланированным шагом, — но кривая глубины, механизм acceptance и оба негатива цитируемы из репозитория уже сегодня.
Доказательства
Рецепты, патчи, бенч-чекпойнты и сырые выводы: DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8. Апстрим-рецепт NVFP4-KV: tonyd2wild (кредит в репозитории). Связанные материалы лаборатории: находка про MoE-ядро на той же паре и раннее исследование 1M-сервинга. Лонгриды: часть 5 и исследование 0731 на Хабре.