Ապացույցների մակարդակ՝
legacy։ Չափված է երկու DGX Spark-ից բաղկացած սեփական կլաստերի վրա v1 մեթոդաբանությունից առաջ — «խնձորները խնձորների հետ» ռեպոյի ներսում (completion_tokens / wall_time, առանց streaming-ի), բայց առանց նախագրանցման։ Թվերը մեջբերումներ են հանրային ռեպոզիտորիից, ոչ թե լաբորատորիայի claim registry-ից։
Աղբյուր (patch-եր, launcher-ներ, բենչմարկ-չեկփոինթներ, հում տվյալներ)՝ github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8 (MIT) · Մանրամասն պատմությունները՝ պորտը և մեկ տողանոց բագը, multi-user serving
Ինչ աշխատանք է սա
Երկու բան՝ առանձին ատրիբուցիայով (լրիվ շղթան՝ ռեպոզիտորիի CREDITS-ում).
- Մեր սեփական fp8 DSpark bring-up-ը GB10/sm_121-ի վրա — DSpark-ի դրաֆտ-գլուխն ու proposer-ը՝ vLLM-ի spec-decode ցիկլի մեջ ներդրված patch-երով (առանց բազային մոդելի ֆորկի), TP=2 երկու DGX Spark-ի միջով 200G RoCEv2-ով, մեկ միլիոն թոքեն կոնտեքստի վրա։ Ներառյալ թվային բագֆիքսերը, որոնք դրաֆտը «կանխատեսում է աղմուկ»-ից հասցրին «համընկնում է էտալոնին»։
- tonyd2wild-ի NVFP4-KV բիլդի անկախ վերարտադրությունն ու ընդլայնված չափումը — բացահայտորեն ո՛չ մեր հեղինակությունն է; վերարտադրված է բայթ առ բայթ և չափված ավելի խորը, քան որևէ տեղ հրապարակված էր։
Պատմական արդյունքներ (մեջբերումներ ռեպոյից)
- fp8 DSpark (մերը). մեկ հոսքի շահույթ՝ +21–24% առանց-spec տարբերակի դիմաց; կոնկուրենտության տակ ~99 tok/s 8 հոսքի վրա և 141–146 tok/s՝ 12-ի վրա (պրոդ-կարգավորումներ)։
- Խորության կորը մինչև 1M (NVFP4 բիլդ, մեր չափումը). 42.7 tok/s 16K-ի վրա → 17.6՝ 512K-ի վրա → 17.2՝ իրական 1.03M թոքենանոց prompt-ի վրա — կորը հարթվում է 512K-ից հետո։ Կցված են սառը prefill-ի և prefix cache-ի տայմինգները լրիվ խորության վրա։
- Վերարտադրություն. կոմյունիթի բիլդի հեղինակի թիվը 16 կոնկուրենտության վրա մեր կլաստերում վերարտադրվեց նրա իսկ վազքերի միջև ցրվածքի սահմաններում — նրա բենչմարկը հաստատված է, նրա նկատմամբ գերազանցություն չի հայտարարվում։
Երկու ազնիվ բացասական արդյունք
- Սեմփլերի ո՛չ մի կոնֆիգուրացիա հուսալիորեն չի շտկում կոհերենտությունը երկար կոնտեքստի վրա չափված բիլդում. կոլապսը խորության ֆիքսված շեմ չէ, իսկ հանրահայտ «կոճակներից» մեկը spec-decode-ի տակ պարզապես արգելափակված է։
- Խորության կորը շարժում է acceptance-ի պոզիցիա-առ-պոզիցիա անկումը, ոչ թե թողունակությունը — հրապարակված վերլուծությամբ՝ «խորհրդավոր դանդաղման» պատմության փոխարեն։
Ինչու է սա կարևոր լաբորատորիայի համար
Այս ռեպոզիտորիան խորը bring-up-ի ապացույց է ոչ ստանդարտ երկաթի վրա (aarch64 + sm_121 — հենց այն տարածքն է, որտեղ «աջակցվում է»-ն ու «աշխատում է»-ն տարբեր բառեր են), անկախ վերարտադրության գործող մոտեցում՝ վաստակի մաքուր տարանջատմամբ, և long-context ու սպեկուլյատիվ դեկոդավորման workload-ների դիզայնի աղբյուր, որոնք այժմ լաբորատորիայի գրադարանում են։
Ինչ այս տվյալները չեն հաստատում
Ո՛չ ընդհանրացում datacenter-ային Blackwell-ի վրա, ո՛չ մոդելի որակի որակավորում, ո՛չ հենց մեր fp8 գծի արտաքին վերարտադրություն (առայժմ)։