# the server must report the B12X backend, not the DEEPGEMM fallback

> vLLM-ի auto MoE բեքենդը բաց է թողնում GB10-ի վրա DeepSeek-V4-Flash-ի համար պատկերում ներառված FlashInfer MXFP4 միջուկը և անցնում է DEEPGEMM ֆոլբեքին. փոխանցեք --moe-backend flashinfer_b12x և սերվերի լոգում հաստատեք B12X բեքենդը։

- Platform: DGX Spark (GB10)
- Runtime: vLLM
- Published: 2026-09-02
- Sources: https://agmind.ai/hy/reports/dsv4-flash-moe-backend-dgx-spark/
- Canonical: https://agmind.ai/hy/symptoms/vllm-auto-moe-backend-skips-mxfp4-kernel-gb10/

## Ինչ եք տեսնում

vLLM-ը մեկնարկում է երկհանգույց DGX Spark զույգի վրա, բեռնում է
DeepSeek-V4-Flash-0731-ը և սպասարկում է հարցումները։ Ոչ մի սխալ, ոչ մի
նախազգուշացում։ Պատկերը պարունակում է FlashInfer MoE միջուկ, որը
հավաքված է այս մոդելային ընտանիքի նատիվ MXFP4 փորձագետների համար
GPU-ների այս սերնդի վրա, և բեքենդի լռելյայն ընտրությունն այն թողնում է
չօգտագործված։ Միակ տեսանելի հետքը սերվերի լոգում բեքենդի անունն է.
DEEPGEMM ֆոլբեքը՝ B12X-ի փոխարեն։ Դեկոդի տարբերությունը երևում է միայն
այն ժամանակ, երբ նույն գործարկումը կրկնում եք՝ միջուկը հարկադրաբար
ընտրած։

Հաշվետվությունից.

```
The runtime's auto backend selection does not pick it.
The check that the flag actually took effect is one log line: the server must report the B12X backend, not the DEEPGEMM fallback.
```

## Որտեղ ենք հանդիպել

Լաբորատորիայի DGX Spark զույգը, GB10, երկու հանգույց RoCE-ով՝ տենզորային
զուգահեռականությամբ։ Runtime՝ հրապարակված բաղադրատոմսում օգտագործված
vLLM պատկերը. նրա digest-ը և մոդելի ռևիզիան ամրագրված են ռեպոզիտորիայի
run-մանիֆեստում, և հաշվետվության էջը դրանցից ոչ մեկը չի բերում։ Մոդել՝
DeepSeek-V4-Flash-0731. չափված չեքփոինթը համայնքի կողմից քվանտավորված
FP8 ածանցյալ է՝ ամրագրված ռևիզիայով։ Պաշտոնական aligned չեքփոինթը նշված
է ռեպոզիտորիայում, բայց չի չափվել։ Յուրաքանչյուր կոնֆիգուրացիայի համար՝
մեկ անցում։ Հաշվետվությունը հրապարակվել է 2026-08-03-ին. գործարկման
ամսաթիվն էջում նշված չէ։

## Պատճառ

Runtime-ի `auto` MoE բեքենդի ընտրությունն այս մոդել-սիլիցիում
զուգակցման դեպքում FlashInfer B12X միջուկը չի ընտրում, ուստի սերվերը
փոխարենը DEEPGEMM ուղով է գնում։ Միջուկը պատկերում կա և հենց այս
համակցության համար ավելի արագն է. auto-ն այն թողնում է չօգտագործված։
Հաշվետվությունը չի ասում, թե ինչու։ Գործարկման ընթացքում ոչինչ չի
մատնում այդ բացթողումը, ուստի այս զուգակցման յուրաքանչյուր լռելյայն
կարգավորումներով տեղակայում ավելի դանդաղ ուղին է աշխատեցնում, և ոչ ոք
չի նկատում, եթե որևէ մեկը լոգը չկարդա։

## Լուծում

Հարկադրեք բեքենդը vLLM-ի հրամանային տողում.

```
--moe-backend flashinfer_b12x
```

Հետո կարդացեք սերվերի լոգը։ MoE բեքենդը նշող տողում պետք է լինի B12X,
ոչ թե DEEPGEMM։ Առանց այդ ստուգման դրոշակը կարող է լուռ ոչինչ չանել։
Կլիենտային կողմի դեկոդի չափված աճը միահոսք կոնտրոլում հաշվետվության մեջ
է. դա մեկ անցում է, և հաշվետվությունը միջինն ու մեդիանն առանձին է
բերում, որովհետև սերիայում մեկ շեղվող արժեք կա։

Սա վերասահմանում է լռելյայնը. այն չի փոխում, թե ինչ է ընտրում `auto`-ն։
Աղբյուրում նկարագրված է միայն վերասահմանումը։

## Բա՞ց է դեռ upstream-ում

Մենք դրան չենք հետևում։ Հաշվետվությունը որևէ upstream issue չի նշում։

## Ապացույցներ

- Հաշվետվություն. [vLLM auto-ն սխալ MoE միջուկ ընտրեց DeepSeek-V4-Flash-ի համար GB10-ի վրա](https://agmind.ai/hy/reports/dsv4-flash-moe-backend-dgx-spark/)
- Բաղադրատոմս, ամրագրված մանիֆեստ և հում ելքեր. [github.com/botAGI/dspark-0731-gb10](https://github.com/botAGI/dspark-0731-gb10)

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
