Ախտանիշի քարտ
HTTP 200, empty answer
Reasoning-անցումն ամբողջ ավարտման բյուջեն ծախսել է մինչև պատասխանի առաջին թոքենը, և սերվերը հաջողություն է հաղորդել՝ ցույց տալու ոչինչ չունենալով; մեծացրեք բյուջեն կամ անջատեք reasoning-ը և հաշվեք պատասխանի թոքենները, ոչ թե ստատուս-կոդերը։
- Պլատֆորմ:
- Ցանկացած լոկալ ստեկ
- Runtime:
- llama.cpp server (Vulkan)
- Հրապարակվել է:
- 02.09.2026
Ինչ եք տեսնում
Հարցումն ավարտվում է։ Սերվերը հոսքով տալիս է թոքեններ և վերադարձնում է հաջողության ստատուս։ Կլիենտը պատասխանի տեքստ ընդհանրապես չի ստանում։ Հաշվետվությունն ախտանիշն անվանում է հենց իր վերնագրում.
HTTP 200, empty answer
Հարցում առ հարցում որակի գրառումներում ամեն այդպիսի հարցում նույն տեսքն ունի.
nonzero reasoning characters and zero answer characters
Մինչ սա տեղի է ունենում, ամեն սովորական serving-մետրիկա առողջ տեսք ունի։
Ստատուսը 200 է։ Ժամանակը մինչև առաջին թոքենը գերազանց է, որովհետև առաջին
թոքենը մտորման թոքեն է։ Գեներացված թոքենները շատ են, որովհետև մոդելն
աշխատել է։ Սա բռնում է միայն մեկ հաշվիչ՝ պատասխանի թոքենները, այն
թոքենները, որ գալիս են reasoning-բլոկի փակվելուց հետո, և գրեթե ոչ ոք
դրանք չի հավաքում։ usage դաշտը, որ երկուսը միաձուլում է, թաքցնում է
խափանումը։
Որտեղ ենք հանդիպել
Strix Halo, llama.cpp Vulkan՝ ամրագրված digest-ով, մեկ հոսք, սառեցված կորպուսներ։ Մոդելների երկու ընտանիք վերարտադրեց այն. Qwen3.6-35B-A3B-ն՝ միացրած reasoning-ով և 1024 թոքեն ավարտման բյուջեով, և Gemma-4-26B-ն՝ իր լռելյայն աշխատանքային ռեժիմում, chat-template-ի վրա, որը reasoning-ի փոխանջատիչ անգամ չունի։ Հաշվետվությունը հրապարակվել է 2026-08-14-ին։ Runtime-ի ճշգրիտ build-ը և մոդելի digest-ը ներքևում հղված claim-էջերում են։
Պատճառ
Մտորման անցումն ու թոքեն-բյուջեն կիսում են ավարտման մեկ պատուհան։ Երբ մոդելը reasoning-բլոկ է արտադրում, այդ բլոկը գրում է պատասխանից առաջ։ Երբ բյուջեն սպառվում է reasoning-բլոկի փակվելուց առաջ, գեներացիան կանգնում է, և պատասխանի ոչ մի թոքեն այդպես էլ չի արտադրվում։ Տրանսպորտը հաջող է աշխատել, ուստի սերվերը հաջողություն է հաղորդում։ Հաշվետվությունը խափանումների բաժինն անվանում է բյուջետային քաղցի կոր, ոչ թե մոդելի դեֆեկտ. այդ բաժինը մոդել × բյուջե × կորպուս բջջի հատկություն է։
Լուծում
Հաշվետվությունը տալիս է երկու կարգավորում և մեկ ստուգում, առանց հրամանային տողի.
- Բյուջե դրեք մտորման համար, ոչ միայն պատասխանի։ Հաշվետվության ձևակերպմամբ՝ 1024 թոքենանոց պատուհանը, որտեղ կտեղավորվեր մեր կորպուսի ցանկացած պատասխան, «մտորում + պատասխան» զույգերից գրեթե ոչ մեկը չի տեղավորում։ Ավարտման բյուջեն չափեք զույգի համար։
- Կամ անջատեք reasoning-ն առօրյա տրաֆիկի համար։ Strix Halo տուփի վրա մտորման բլոկի անջատումն առաջին պատասխանի սպասումը տասնյակ վայրկյաններից իջեցրեց մինչև claim-էջի արժեքը՝ այս workload-ների վրա խնդիրների անփոփոխ հաջողությամբ։ Զուգակցված բջիջները reasoning-ի գնի համեմատության մեջ են։
- Հետևեք պատասխանի թոքեններին։ Հաշվեք թոքենները reasoning-բլոկի փակվելուց հետո և դատարկ պատասխանը դիտեք որպես ձախողված հարցում, նույնիսկ երբ տրանսպորտը հաջող է աշխատել։ Հենց դրա համար մեր harness-ը TTFA-ն հաշվում է TTFT-ից առանձին և answerless-հարցումները պահում է հայտարարի մեջ։
Բա՞ց է դեռ upstream-ում
Մենք չենք հետևում։ Աղբյուրներից ոչ մեկը upstream issue չի նշում; հաշվետվությունը խափանումների բաժինը վերագրում է բյուջետային քաղցին, ոչ թե runtime-ի կամ մոդելի դեֆեկտին։
Ապացույցներ
- Հաշվետվություն. HTTP 200 և դատարկ պատասխան. խափանման ռեժիմը, որը ձեր մոնիտորինգը չի տեսնում
- Բառարան. անպատասխան հարցում (answerless)
- Claim-էջեր. Qwen3.6-ի answerless բաժինը ստուգված բյուջեով, Gemma-4-ի answerless բաժինը լռելյայն ռեժիմում
- Հարցում առ հարցում որակի գրառումներ. botAGI/agmind-lab
- Առնչվող կոնֆիգուրացիա. Strix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B
- Առնչվող ախտանիշ. մտորման հոսքը սկսվում է անմիջապես, պատասխանը գալիս է ուշ կամ երբեք
Աղբյուրներ
- HTTP 200 և դատարկ պատասխան. խափանման ռեժիմը, որը ձեր մոնիտորինգը չի տեսնում · /reports/answerless-http-200/
- /glossary/#answerless-request
Այս քարտը փաստագրում է լաբորատորիայի սեփական երկաթի վրա դիտարկված մեկ խափանում; թվերը, եթե կան, ապրում են հղված աղբյուր էջում, ոչ թե այստեղ։