Հաշվետվություն

vLLM auto-ն սխալ MoE միջուկ ընտրեց DeepSeek-V4-Flash-ի համար GB10-ի վրա

DeepSeek-V4-Flash-0731-ը երկու DGX Spark հանգույցի վրա. պատկերը պարունակում է MoE միջուկ այս մոդելի MXFP4 փորձագետների համար այս սիլիցիումի վրա, բայց auto-ն այն բաց է թողնում։ Ձեռքով ընտրությունն արժե դեկոդի երկնիշ տոկոսներ։ Բաղադրատոմսն ու հում արդյունքները բաց են։

lab_single_run internal research 03 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Նշում շրջանակի մասին։ Այս հետազոտությունն ընթացել է լաբորատորիայի DGX Spark զույգի վրա՝ սեփական ամրագրված harness-ով. պատկերի digest-ը, մոդելի ռևիզիան և մետրիկների բանաձևերը ռեպոզիտորիայի run-մանիֆեստում են, հում ելքերը՝ results/raw/-ում։ Այն դեռ չի մտնում մեր քարտերի հետևում կանգնած claim registry. ստորև թվերը մեջբերվում են հրապարակված ռեպոզիտորիայից, որտեղ դրանք կարելի է ստուգել հում գրառումների դիմաց։

Գտածոն

DeepSeek-V4-Flash-0731-ը՝ 284B պարամետրով MoE՝ ~13B ակտիվով, սպասարկվում է երկու DGX Spark (GB10) հանգույցի վրա RoCE-ով՝ տենզորային զուգահեռականությամբ։ Runtime-ի պատկերը պարունակում է FlashInfer MoE միջուկ, որը հավաքված է հատուկ այս մոդելային ընտանիքի նատիվ MXFP4 փորձագետների համար GPU-ների այս սերնդի վրա։ Բեքենդի ավտոընտրությունը (auto) այն չի ընտրում։

Ձեռքով հարկադիր ընտրությունը (--moe-backend flashinfer_b12x) արժե +13.3% միջինով և +16.6% մեդիանով դեկոդի կլիենտային մետրիկայի վրա միահոսք կոնտրոլում. սերիայում կա մեկ արտանետում, ուստի ռեպոզիտորիան բերում է երկու վիճակագրությունն էլ։ Ստուգումը, որ դրոշակն իրոք գործել է, լոգի մեկ տողն է. սերվերը պետք է հաշվետու լինի B12X բեքենդի, ոչ թե DEEPGEMM ֆոլբեքի մասին։ Առանց այս ստուգման դրոշակը կարող է լուռ ոչինչ չանել։

Ինչու է սրա տեղը որակավորման լաբորատորիայում

Լռելյայնը վճիռ չէ։ Միջուկը կա պատկերում, այն ավելի արագ է հենց այս մոդել-այս-սիլիցիումի-վրա կապակցության համար և բացառված է ավտոմատ ընտրությունից — ուրեմն այս զույգի յուրաքանչյուր «տուփից դուրս» տեղակայում սեղանին է թողնում դեկոդի երկնիշ տոկոսներ՝ առանց մեկ սխալի, նախազգուշացման կամ տեսանելի նշանի։ Իմանալու միակ ճանապարհը՝ չափել այն կոնֆիգուրացիան, որն իրականում գործարկում ես, և կարդալ լոգերը՝ հաստատելու, թե runtime-ն իրականում ինչ արեց։ Սա լաբորատորիայի ամբողջ փաստարկն է մեկ դեպքի մեջ։

Ինչ է տալիս ռեպոզիտորիան

Երկհանգույց head-first գործարկման սկրիպտ՝ ֆաբրիկայի փաստաթղթավորված թակարդներով (peer-ը չպետք է միանա ավելի շուտ, քան գլխային հանգույցի store-ը կսկսի լսել), բենչմարկ-harness երկու բեռնվածքային պրոֆիլով և մաքուր դեկոդի ռեժիմով, որը չափում և բացառում է TTFT-ն, պատկերի ամրագրված digest և մոդելի ռևիզիա, և բենչմարկների հում ելքեր։ Չափվել է community-քվանտավորված FP8 դերիվատիվը՝ ամրագրված ռևիզիայով. պաշտոնական aligned չեքփոինթը նշված է, բայց չի չափվել — ռեպոզիտորիան դա ասում է բացահայտ, և մենք նույնպես։

Ինչ սա չի հաստատում

Claim registry-ում առայժմ թվեր չկան. DGX Spark գիծը դեռ չի անցել մեթոդաբանություն v1-ը (սառեցված կորպուսներ, ապացույցների փաթեթներ, դուրսբերվող claim-ներ) — սա այս ստենդի պլանավորված հաջորդ քայլն է։ Մեկ անցում մեկ կոնֆիգուրացիային։ Ոչ մի համեմատություն այլ սարքերի հետ, և այստեղից ոչինչ չի տեղափոխվում պաշտոնական չեքփոինթի, մոդելների այլ չափերի կամ պատկերի ապագա տարբերակների վրա։

Ապացույցներ

Այս հետազոտության լոնգրիդ տարբերակը՝ Habr-ում. DeepSeek 0731-ը DGX Spark-ի վրա։ Բաղադրատոմսը, մանիֆեստը և հում ելքերը՝ github.com/botAGI/dspark-0731-gb10։ Մեր չափողական harness-ը որակավորման գծերի համար՝ agmind-bench։

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-03). vLLM auto-ն սխալ MoE միջուկ ընտրեց DeepSeek-V4-Flash-ի համար GB10-ի վրա. Evidence level: lab_single_run. https://agmind.ai/hy/reports/dsv4-flash-moe-backend-dgx-spark/
← Հաշվետվություններ