# DeepSeek-V4-Flash DSpark 2× DGX Spark-ի վրա. 1M կոնտեքստ — legacy արդյունքներ

> DSpark սպեկուլյատիվ դեկոդավորման bring-up GB10-ի (sm_121) վրա 200G RoCE-ով, խորության կորը մինչև մեկ միլիոն թոքեն, կոմյունիթի բիլդի անկախ վերարտադրություն և երկու ազնիվ բացասական արդյունք։

- Published: 2026-07-31
- Evidence level: legacy
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/dspark-dgx-spark-1m-legacy/

> **Ապացույցների մակարդակ՝ `legacy`։** Չափված է երկու DGX Spark-ից բաղկացած
> սեփական կլաստերի վրա v1 մեթոդաբանությունից առաջ — «խնձորները խնձորների
> հետ» ռեպոյի ներսում (completion_tokens / wall_time, առանց streaming-ի),
> բայց առանց նախագրանցման։ Թվերը մեջբերումներ են հանրային ռեպոզիտորիից,
> ոչ թե լաբորատորիայի claim registry-ից։

**Աղբյուր (patch-եր, launcher-ներ, բենչմարկ-չեկփոինթներ, հում տվյալներ)՝**
[github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8](https://github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8) (MIT)
· Մանրամասն պատմությունները՝ [պորտը և մեկ տողանոց բագը](https://habr.com/ru/articles/1055792/), [multi-user serving](https://habr.com/ru/articles/1050470/)

## Ինչ աշխատանք է սա

Երկու բան՝ առանձին ատրիբուցիայով (լրիվ շղթան՝ ռեպոզիտորիի CREDITS-ում).

1. **Մեր սեփական fp8 DSpark bring-up-ը GB10/sm_121-ի վրա** — DSpark-ի
   դրաֆտ-գլուխն ու proposer-ը՝ vLLM-ի spec-decode ցիկլի մեջ ներդրված
   patch-երով (առանց բազային մոդելի ֆորկի), TP=2 երկու DGX Spark-ի միջով
   200G RoCEv2-ով, մեկ միլիոն թոքեն կոնտեքստի վրա։ Ներառյալ թվային
   բագֆիքսերը, որոնք դրաֆտը «կանխատեսում է աղմուկ»-ից հասցրին «համընկնում
   է էտալոնին»։
2. **tonyd2wild-ի NVFP4-KV բիլդի անկախ վերարտադրությունն ու ընդլայնված
   չափումը** — բացահայտորեն ո՛չ մեր հեղինակությունն է; վերարտադրված է
   բայթ առ բայթ և չափված ավելի խորը, քան որևէ տեղ հրապարակված էր։

## Պատմական արդյունքներ (մեջբերումներ ռեպոյից)

- **fp8 DSpark (մերը).** մեկ հոսքի շահույթ՝ +21–24% առանց-spec տարբերակի դիմաց; կոնկուրենտության տակ ~99 tok/s 8 հոսքի վրա և 141–146 tok/s՝ 12-ի վրա (պրոդ-կարգավորումներ)։
- **Խորության կորը մինչև 1M (NVFP4 բիլդ, մեր չափումը).** 42.7 tok/s 16K-ի վրա → 17.6՝ 512K-ի վրա → 17.2՝ իրական 1.03M թոքենանոց prompt-ի վրա — կորը հարթվում է 512K-ից հետո։ Կցված են սառը prefill-ի և prefix cache-ի տայմինգները լրիվ խորության վրա։
- **Վերարտադրություն.** կոմյունիթի բիլդի հեղինակի թիվը 16 կոնկուրենտության
  վրա մեր կլաստերում վերարտադրվեց նրա իսկ վազքերի միջև ցրվածքի
  սահմաններում — նրա բենչմարկը հաստատված է, նրա նկատմամբ գերազանցություն
  չի հայտարարվում։

## Երկու ազնիվ բացասական արդյունք

1. **Սեմփլերի ո՛չ մի կոնֆիգուրացիա հուսալիորեն չի շտկում կոհերենտությունը
   երկար կոնտեքստի վրա** չափված բիլդում. կոլապսը խորության ֆիքսված շեմ
   չէ, իսկ հանրահայտ «կոճակներից» մեկը spec-decode-ի տակ պարզապես
   արգելափակված է։
2. **Խորության կորը շարժում է acceptance-ի պոզիցիա-առ-պոզիցիա անկումը,
   ոչ թե թողունակությունը** — հրապարակված վերլուծությամբ՝ «խորհրդավոր
   դանդաղման» պատմության փոխարեն։

## Ինչու է սա կարևոր լաբորատորիայի համար

Այս ռեպոզիտորիան խորը bring-up-ի ապացույց է ոչ ստանդարտ երկաթի վրա
(aarch64 + sm_121 — հենց այն տարածքն է, որտեղ «աջակցվում է»-ն ու
«աշխատում է»-ն տարբեր բառեր են), անկախ վերարտադրության գործող մոտեցում՝
վաստակի մաքուր տարանջատմամբ, և long-context ու սպեկուլյատիվ դեկոդավորման
workload-ների դիզայնի աղբյուր, որոնք այժմ լաբորատորիայի գրադարանում են։

## Ինչ այս տվյալները չեն հաստատում

Ո՛չ ընդհանրացում datacenter-ային Blackwell-ի վրա, ո՛չ մոդելի որակի
որակավորում, ո՛չ հենց *մեր* fp8 գծի արտաքին վերարտադրություն (առայժմ)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
