# vLLM auto-ն սխալ MoE միջուկ ընտրեց DeepSeek-V4-Flash-ի համար GB10-ի վրա

> DeepSeek-V4-Flash-0731-ը երկու DGX Spark հանգույցի վրա. պատկերը պարունակում է MoE միջուկ այս մոդելի MXFP4 փորձագետների համար այս սիլիցիումի վրա, բայց auto-ն այն բաց է թողնում։ Ձեռքով ընտրությունն արժե դեկոդի երկնիշ տոկոսներ։ Բաղադրատոմսն ու հում արդյունքները բաց են։

- Published: 2026-08-03
- Evidence level: lab_single_run
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/dsv4-flash-moe-backend-dgx-spark/

> **Նշում շրջանակի մասին։** Այս հետազոտությունն ընթացել է լաբորատորիայի DGX
> Spark զույգի վրա՝ սեփական ամրագրված harness-ով. պատկերի digest-ը, մոդելի
> ռևիզիան և մետրիկների բանաձևերը ռեպոզիտորիայի run-մանիֆեստում են, հում
> ելքերը՝ `results/raw/`-ում։ Այն դեռ չի մտնում մեր քարտերի հետևում կանգնած
> claim registry. ստորև թվերը մեջբերվում են հրապարակված ռեպոզիտորիայից,
> որտեղ դրանք կարելի է ստուգել հում գրառումների դիմաց։

## Գտածոն

DeepSeek-V4-Flash-0731-ը՝ 284B պարամետրով MoE՝ ~13B ակտիվով, սպասարկվում է երկու DGX Spark (GB10) հանգույցի վրա RoCE-ով՝ տենզորային զուգահեռականությամբ։
Runtime-ի պատկերը պարունակում է FlashInfer MoE միջուկ, որը հավաքված է հատուկ
այս մոդելային ընտանիքի նատիվ MXFP4 փորձագետների համար GPU-ների այս սերնդի
վրա։ Բեքենդի ավտոընտրությունը (`auto`) այն **չի ընտրում**։

Ձեռքով հարկադիր ընտրությունը (`--moe-backend flashinfer_b12x`) արժե +13.3% միջինով և +16.6% մեդիանով դեկոդի կլիենտային մետրիկայի վրա միահոսք կոնտրոլում. սերիայում կա մեկ արտանետում, ուստի ռեպոզիտորիան բերում է երկու վիճակագրությունն էլ։
Ստուգումը, որ դրոշակն իրոք գործել է, լոգի մեկ տողն է. սերվերը պետք է հաշվետու
լինի B12X բեքենդի, ոչ թե DEEPGEMM ֆոլբեքի մասին։ Առանց այս ստուգման դրոշակը
կարող է լուռ ոչինչ չանել։

## Ինչու է սրա տեղը որակավորման լաբորատորիայում

Լռելյայնը վճիռ չէ։ Միջուկը կա պատկերում, այն ավելի արագ է հենց այս
մոդել-այս-սիլիցիումի-վրա կապակցության համար և բացառված է ավտոմատ ընտրությունից
— ուրեմն այս զույգի յուրաքանչյուր «տուփից դուրս» տեղակայում սեղանին է թողնում
դեկոդի երկնիշ տոկոսներ՝ առանց մեկ սխալի, նախազգուշացման կամ տեսանելի նշանի։
Իմանալու միակ ճանապարհը՝ չափել այն կոնֆիգուրացիան, որն իրականում գործարկում
ես, և կարդալ լոգերը՝ հաստատելու, թե runtime-ն իրականում ինչ արեց։ Սա
լաբորատորիայի ամբողջ փաստարկն է մեկ դեպքի մեջ։

## Ինչ է տալիս ռեպոզիտորիան

Երկհանգույց head-first գործարկման սկրիպտ՝ ֆաբրիկայի փաստաթղթավորված
թակարդներով (peer-ը չպետք է միանա ավելի շուտ, քան գլխային հանգույցի store-ը
կսկսի լսել), բենչմարկ-harness երկու բեռնվածքային պրոֆիլով և մաքուր դեկոդի
ռեժիմով, որը չափում և բացառում է TTFT-ն, պատկերի ամրագրված digest և մոդելի
ռևիզիա, և բենչմարկների հում ելքեր։ Չափվել է community-քվանտավորված FP8
դերիվատիվը՝ ամրագրված ռևիզիայով. պաշտոնական aligned չեքփոինթը նշված է, բայց
չի չափվել — ռեպոզիտորիան դա ասում է բացահայտ, և մենք նույնպես։

## Ինչ սա չի հաստատում

Claim registry-ում առայժմ թվեր չկան. DGX Spark գիծը դեռ չի անցել
մեթոդաբանություն v1-ը (սառեցված կորպուսներ, ապացույցների փաթեթներ, դուրսբերվող
claim-ներ) — սա այս ստենդի պլանավորված հաջորդ քայլն է։ Մեկ անցում մեկ
կոնֆիգուրացիային։ Ոչ մի համեմատություն այլ սարքերի հետ, և այստեղից ոչինչ չի
տեղափոխվում պաշտոնական չեքփոինթի, մոդելների այլ չափերի կամ պատկերի ապագա
տարբերակների վրա։

## Ապացույցներ

Այս հետազոտության լոնգրիդ տարբերակը՝ Habr-ում.
[DeepSeek 0731-ը DGX Spark-ի վրա](https://habr.com/ru/articles/1066164/)։
Բաղադրատոմսը, մանիֆեստը և հում ելքերը՝
[github.com/botAGI/dspark-0731-gb10](https://github.com/botAGI/dspark-0731-gb10)։
Մեր չափողական harness-ը որակավորման գծերի համար՝
[agmind-bench](https://github.com/botAGI/agmind-bench)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
