# HTTP 200, empty answer

> Reasoning-անցումն ամբողջ ավարտման բյուջեն ծախսել է մինչև պատասխանի առաջին թոքենը, և սերվերը հաջողություն է հաղորդել՝ ցույց տալու ոչինչ չունենալով; մեծացրեք բյուջեն կամ անջատեք reasoning-ը և հաշվեք պատասխանի թոքենները, ոչ թե ստատուս-կոդերը։

- Platform: Ցանկացած լոկալ ստեկ
- Runtime: llama.cpp server (Vulkan)
- Published: 2026-09-02
- Sources: https://agmind.ai/hy/reports/answerless-http-200/, https://agmind.ai/hy/glossary/#answerless-request
- Canonical: https://agmind.ai/hy/symptoms/llama-server-http-200-empty-content/

## Ինչ եք տեսնում

Հարցումն ավարտվում է։ Սերվերը հոսքով տալիս է թոքեններ և վերադարձնում է
հաջողության ստատուս։ Կլիենտը պատասխանի տեքստ ընդհանրապես չի ստանում։
Հաշվետվությունն ախտանիշն անվանում է հենց իր վերնագրում.

```text
HTTP 200, empty answer
```

Հարցում առ հարցում որակի գրառումներում ամեն այդպիսի հարցում նույն
տեսքն ունի.

```text
nonzero reasoning characters and zero answer characters
```

Մինչ սա տեղի է ունենում, ամեն սովորական serving-մետրիկա առողջ տեսք ունի։
Ստատուսը 200 է։ Ժամանակը մինչև առաջին թոքենը գերազանց է, որովհետև առաջին
թոքենը մտորման թոքեն է։ Գեներացված թոքենները շատ են, որովհետև մոդելն
աշխատել է։ Սա բռնում է միայն մեկ հաշվիչ՝ պատասխանի թոքենները, այն
թոքենները, որ գալիս են reasoning-բլոկի փակվելուց հետո, և գրեթե ոչ ոք
դրանք չի հավաքում։ `usage` դաշտը, որ երկուսը միաձուլում է, թաքցնում է
խափանումը։

## Որտեղ ենք հանդիպել

Strix Halo, llama.cpp Vulkan՝ ամրագրված digest-ով, մեկ հոսք, սառեցված
կորպուսներ։ Մոդելների երկու ընտանիք վերարտադրեց այն. Qwen3.6-35B-A3B-ն՝
միացրած reasoning-ով և 1024 թոքեն ավարտման բյուջեով, և Gemma-4-26B-ն՝ իր
լռելյայն աշխատանքային ռեժիմում, chat-template-ի վրա, որը reasoning-ի
փոխանջատիչ անգամ չունի։ Հաշվետվությունը հրապարակվել է 2026-08-14-ին։
Runtime-ի ճշգրիտ build-ը և մոդելի digest-ը ներքևում հղված claim-էջերում
են։

## Պատճառ

Մտորման անցումն ու թոքեն-բյուջեն կիսում են ավարտման մեկ պատուհան։ Երբ
մոդելը reasoning-բլոկ է արտադրում, այդ բլոկը գրում է պատասխանից առաջ։
Երբ բյուջեն սպառվում է reasoning-բլոկի փակվելուց առաջ, գեներացիան
կանգնում է, և պատասխանի ոչ մի թոքեն այդպես էլ չի արտադրվում։ Տրանսպորտը
հաջող է աշխատել, ուստի սերվերը հաջողություն է հաղորդում։ Հաշվետվությունը
խափանումների բաժինն անվանում է բյուջետային քաղցի կոր, ոչ թե մոդելի
դեֆեկտ. այդ բաժինը մոդել × բյուջե × կորպուս բջջի հատկություն է։

## Լուծում

Հաշվետվությունը տալիս է երկու կարգավորում և մեկ ստուգում, առանց
հրամանային տողի.

- **Բյուջե դրեք մտորման համար, ոչ միայն պատասխանի։** Հաշվետվության
  ձևակերպմամբ՝ 1024 թոքենանոց պատուհանը, որտեղ կտեղավորվեր մեր կորպուսի
  ցանկացած պատասխան, «մտորում + պատասխան» զույգերից գրեթե ոչ մեկը չի
  տեղավորում։ Ավարտման բյուջեն չափեք զույգի համար։
- **Կամ անջատեք reasoning-ն առօրյա տրաֆիկի համար։** Strix Halo տուփի վրա
  մտորման բլոկի անջատումն առաջին պատասխանի սպասումը տասնյակ վայրկյաններից
  իջեցրեց մինչև
  [claim-էջի](https://agmind.ai/hy/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)
  արժեքը՝ այս workload-ների վրա խնդիրների անփոփոխ հաջողությամբ։ Զուգակցված
  բջիջները
  [reasoning-ի գնի համեմատության](https://agmind.ai/hy/compare/thinking-vs-no-thinking-qwen36/)
  մեջ են։
- **Հետևեք պատասխանի թոքեններին։** Հաշվեք թոքենները reasoning-բլոկի
  փակվելուց հետո և դատարկ պատասխանը դիտեք որպես ձախողված հարցում, նույնիսկ
  երբ տրանսպորտը հաջող է աշխատել։ Հենց դրա համար մեր harness-ը
  [TTFA](https://agmind.ai/hy/glossary/#ttfa)-ն հաշվում է TTFT-ից առանձին և
  answerless-հարցումները պահում է հայտարարի մեջ։

## Բա՞ց է դեռ upstream-ում

Մենք չենք հետևում։ Աղբյուրներից ոչ մեկը upstream issue չի նշում;
հաշվետվությունը խափանումների բաժինը վերագրում է բյուջետային քաղցին, ոչ
թե runtime-ի կամ մոդելի դեֆեկտին։

## Ապացույցներ

- Հաշվետվություն. [HTTP 200 և դատարկ պատասխան. խափանման ռեժիմը, որը ձեր մոնիտորինգը չի տեսնում](https://agmind.ai/hy/reports/answerless-http-200/)
- Բառարան. [անպատասխան հարցում (answerless)](https://agmind.ai/hy/glossary/#answerless-request)
- Claim-էջեր. [Qwen3.6-ի answerless բաժինը ստուգված բյուջեով](https://agmind.ai/hy/claims/strix.qwen36.interactive2.c1.answerless-1k/), [Gemma-4-ի answerless բաժինը լռելյայն ռեժիմում](https://agmind.ai/hy/claims/strix.gemma4.interactive2.c1.answerless-default/)
- Հարցում առ հարցում որակի գրառումներ. [botAGI/agmind-lab](https://github.com/botAGI/agmind-lab)
- Առնչվող կոնֆիգուրացիա. [Strix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B](https://agmind.ai/hy/tested-configurations/strix-halo-qwen36-llamacpp-vulkan-interactive/)
- Առնչվող ախտանիշ. [մտորման հոսքը սկսվում է անմիջապես, պատասխանը գալիս է ուշ կամ երբեք](https://agmind.ai/hy/symptoms/thinking-model-first-token-instant-answer-late/)

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
