Ախտանիշի քարտ

the server must report the B12X backend, not the DEEPGEMM fallback

vLLM-ի auto MoE բեքենդը բաց է թողնում GB10-ի վրա DeepSeek-V4-Flash-ի համար պատկերում ներառված FlashInfer MXFP4 միջուկը և անցնում է DEEPGEMM ֆոլբեքին. փոխանցեք --moe-backend flashinfer_b12x և սերվերի լոգում հաստատեք B12X բեքենդը։

Պլատֆորմ:
DGX Spark (GB10)
Runtime:
vLLM
Հրապարակվել է:
02.09.2026

Ինչ եք տեսնում

vLLM-ը մեկնարկում է երկհանգույց DGX Spark զույգի վրա, բեռնում է DeepSeek-V4-Flash-0731-ը և սպասարկում է հարցումները։ Ոչ մի սխալ, ոչ մի նախազգուշացում։ Պատկերը պարունակում է FlashInfer MoE միջուկ, որը հավաքված է այս մոդելային ընտանիքի նատիվ MXFP4 փորձագետների համար GPU-ների այս սերնդի վրա, և բեքենդի լռելյայն ընտրությունն այն թողնում է չօգտագործված։ Միակ տեսանելի հետքը սերվերի լոգում բեքենդի անունն է. DEEPGEMM ֆոլբեքը՝ B12X-ի փոխարեն։ Դեկոդի տարբերությունը երևում է միայն այն ժամանակ, երբ նույն գործարկումը կրկնում եք՝ միջուկը հարկադրաբար ընտրած։

Հաշվետվությունից.

The runtime's auto backend selection does not pick it.
The check that the flag actually took effect is one log line: the server must report the B12X backend, not the DEEPGEMM fallback.

Որտեղ ենք հանդիպել

Լաբորատորիայի DGX Spark զույգը, GB10, երկու հանգույց RoCE-ով՝ տենզորային զուգահեռականությամբ։ Runtime՝ հրապարակված բաղադրատոմսում օգտագործված vLLM պատկերը. նրա digest-ը և մոդելի ռևիզիան ամրագրված են ռեպոզիտորիայի run-մանիֆեստում, և հաշվետվության էջը դրանցից ոչ մեկը չի բերում։ Մոդել՝ DeepSeek-V4-Flash-0731. չափված չեքփոինթը համայնքի կողմից քվանտավորված FP8 ածանցյալ է՝ ամրագրված ռևիզիայով։ Պաշտոնական aligned չեքփոինթը նշված է ռեպոզիտորիայում, բայց չի չափվել։ Յուրաքանչյուր կոնֆիգուրացիայի համար՝ մեկ անցում։ Հաշվետվությունը հրապարակվել է 2026-08-03-ին. գործարկման ամսաթիվն էջում նշված չէ։

Պատճառ

Runtime-ի auto MoE բեքենդի ընտրությունն այս մոդել-սիլիցիում զուգակցման դեպքում FlashInfer B12X միջուկը չի ընտրում, ուստի սերվերը փոխարենը DEEPGEMM ուղով է գնում։ Միջուկը պատկերում կա և հենց այս համակցության համար ավելի արագն է. auto-ն այն թողնում է չօգտագործված։ Հաշվետվությունը չի ասում, թե ինչու։ Գործարկման ընթացքում ոչինչ չի մատնում այդ բացթողումը, ուստի այս զուգակցման յուրաքանչյուր լռելյայն կարգավորումներով տեղակայում ավելի դանդաղ ուղին է աշխատեցնում, և ոչ ոք չի նկատում, եթե որևէ մեկը լոգը չկարդա։

Լուծում

Հարկադրեք բեքենդը vLLM-ի հրամանային տողում.

--moe-backend flashinfer_b12x

Հետո կարդացեք սերվերի լոգը։ MoE բեքենդը նշող տողում պետք է լինի B12X, ոչ թե DEEPGEMM։ Առանց այդ ստուգման դրոշակը կարող է լուռ ոչինչ չանել։ Կլիենտային կողմի դեկոդի չափված աճը միահոսք կոնտրոլում հաշվետվության մեջ է. դա մեկ անցում է, և հաշվետվությունը միջինն ու մեդիանն առանձին է բերում, որովհետև սերիայում մեկ շեղվող արժեք կա։

Սա վերասահմանում է լռելյայնը. այն չի փոխում, թե ինչ է ընտրում auto-ն։ Աղբյուրում նկարագրված է միայն վերասահմանումը։

Բա՞ց է դեռ upstream-ում

Մենք դրան չենք հետևում։ Հաշվետվությունը որևէ upstream issue չի նշում։

Ապացույցներ

Աղբյուրներ

Այս քարտը փաստագրում է լաբորատորիայի սեփական երկաթի վրա դիտարկված մեկ խափանում; թվերը, եթե կան, ապրում են հղված աղբյուր էջում, ոչ թե այստեղ։

← Բոլոր ախտանիշների քարտերը