# Time-to-first-token-ը ոչինչ չի ասում մտածող մոդելի մասին

> Strix Halo արկղի վրա սովորական TTFT թիվը գերազանց տեսք ուներ, մինչդեռ հարցումների մեծ մասը HTTP 200-ով դատարկ պատասխան էր վերադարձնում։ Կլիենտային չափումներ, երեք աշխատանքային ռեժիմ, evidence-փաթեթները կցված են։

- Published: 2026-08-02
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/ttft-thinking-model-strix-halo/

> **Ապացույցների մակարդակը՝ `lab_repeated`։** Ստորև բերված յուրաքանչյուր թիվ
> նորից դուրս է բերվում հարցումների հում գրառումներից հենց այն հարցումով, որը
> նշված է claim registry-ում, — ոչ մեկը ձեռքով գրված չէ այս էջում։ Խորությունը
> ախտորոշիչ է. երեք չափված անցում մեկ ռեժիմին, concurrency 1, մեկ միավոր։ Սա
> հետազոտություն է, որն ապացուցում է կոնվեյերի աշխատունակությունը դրոշակակիր
> չափումից առաջ, ոչ թե բուն դրոշակակիրը։ Երկրորդ միավորի վրա ռեպլիկացիայով
> թվերը դուրս կգան սառեցված պրեռեգիստրացիայի հետ միասին։

## Կարճ ասած

Մոդելը, որը մտածում է պատասխանելուց առաջ, կոտրում է այն մետրիկան, որը բոլորը
մեջբերում են։

Փորձարկված կոնֆիգուրացիայի վրա մինչև առաջին թոքենի սովորական ժամանակը
գերազանց տեսք ունի՝ վայրկյանի հինգերորդ մասը։ Բայց այդ առաջին թոքենը
**մտորման** թոքեն է։ Բուն պատասխանի առաջին թոքենը գալիս է մոտ հարյուր անգամ
ավելի ուշ, իսկ տարածված թոքենային բյուջեի դեպքում հարցումների մեծ մասն
ընդհանրապես պատասխան չի տալիս. կանչող կողմը ստանում է HTTP 200 և դատարկ տող։

Բենչմարկում, որը հաշվետու է լինում թոքեն/վայրկյան ցուցանիշով, սա տեսանելի չէ։

## Ինչ էր չափվում

| Ինքնություն | Արժեք |
|---|---|
| Համակարգ | Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S / gfx1151, 128 ԳԲ unified) |
| Runtime | llama.cpp `server-vulkan-b9049`, ամրագրված պատկերի digest-ով |
| Մոդել | Qwen3.6-35B-A3B Q4_K_M `ggml-org`-ից, ներբեռնված ամրագրված ռևիզիայով և ստուգված հեշով |
| Workload | `interactive-assistant-v1` @ 2026-08-02 — 16 սառեցված պրոմպտ, EN և RU, երկարության երեք տիրույթ |
| Բջիջ | concurrency 1, կոնտեքստ 8192, temperature 0, prompt cache-ն անջատված |

Չափումը **կլիենտային** է. վայրկյանաչափը մեկնարկում է հարցումի ուղարկման պահին
և ժամանակը վերցնում է թոքենների վրա՝ ըստ դրանց ժամանման։ Սերվերային
`timings`-ը կթաքցներ հենց այն էֆեկտը, որին նվիրված է այս հաշվետվությունը։
Յուրաքանչյուր հարցում կրում է եզակի աղ, prompt cache-ն անջատված է — ոչինչ չի
պատասխանվում նախորդ հարցումի աշխատանքի հաշվին։

Անցկացվել են երեք ռեժիմ՝ փոխելով մեկ բան միանգամից.

1. մտորումը միացված է, բյուջեն՝ 1024 թոքեն;
2. մտորումը միացված է, բյուջեն՝ 4096 թոքեն;
3. մտորումն անջատված է chat template-ի միջոցով, բյուջեն՝ 1024 թոքեն։

## Արդյունքներ

**Առաջին թոքենի սովորական թիվը նույնն է բոլոր երեք ռեժիմներում**՝ մոտ
**221 ms** ([strix.qwen36.interactive.c1.ttft-any-token](https://agmind.ai/claims/strix.qwen36.interactive.c1.ttft-any-token/))։ Այն չի
տարբերում կոնֆիգուրացիան, որն անմիջապես պատասխանում է, նրանից, որը երբեք չի
պատասխանում։

**Միացված մտորման դեպքում պատասխանը սկսվում է շատ ավելի ուշ։** 4096 բյուջեի
դեպքում **պատասխանի** առաջին թոքենը գալիս է
**23453 ms** ([strix.qwen36.interactive.c1.ttfa-thinking](https://agmind.ai/claims/strix.qwen36.interactive.c1.ttfa-thinking/)) մեդիանով։ Այս
ամբողջ ընթացքում օգտվողը նայում է թոքենների հոսքին — մոդելը բարձրաձայն մտածում
է, ոչ թե պատասխանում։

**Ավելի փոքր բյուջեի դեպքում հարցումների մեծ մասը պատասխան չտվեց։** Միացված
մտորմամբ և 1024 թոքեն բյուջեով հարցումների
**75.0 % of requests** ([strix.qwen36.interactive.c1.answerless-1k](https://agmind.ai/claims/strix.qwen36.interactive.c1.answerless-1k/))-ը վերադարձրին
հաջող HTTP պատասխան՝ դատարկ բովանդակությամբ. մտորումը կերավ ամբողջ բյուջեն
նախքան պատասխանի սկսվելը։ Հավելվածը, որը նայում է միայն ստատուս-կոդերին,
դրանք կգրանցեր հաջողվածների շարքում։

**Մտորման անջատումը փակում է ճեղքը։** Անջատված մտորման բլոկով պատասխանի
առաջին թոքենը գալիս է
**220 ms** ([strix.qwen36.interactive.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive.c1.ttfa-nothink/))-ում — պատասխանը
սկսվում է հոսքի հետ միասին։ Մեդիանային ծայրից ծայր ժամանակը նվազեց մոտ հինգ
անգամ՝ մտորմամբ և 4096 բյուջեով բջջի համեմատ, իսկ պատասխանները նախկինի պես
անցան լեզվի և կրկնությունների գեյթերը։

**Մեկ գեյթ չանցավ ոչ մի ռեժիմում։** Պատասխանների կեսը դուրս եկավ պրոմպտի
համար հայտարարված բառերի բյուջեից։ Սա մոդելի շատախոսության հատկությունն է, ոչ
թե մտորման ռեժիմի, — և հենց դրա համար կոնֆիգուրացիան այս workload-ի վրա
անվերապահ pass չէր ստանա։

## Ինչ է սա նշանակում գործնականում

- **Առաջին թոքենի թիվն առանց սահմանման անօգուտ է։** Հարցրեք՝ ո՞ր թոքենն է
  դա. հոսքի առաջինը, թե պատասխանին պատկանող առաջինը։ Մտածող մոդելի վրա սրանք
  երկու տարբեր հարցեր են՝ հարյուր անգամ տարբերությամբ։
- **Թոքենային բյուջեն կոռեկտության կարգավորում է, ոչ միայն արժեքի։** Մտորման
  անցումին անհրաժեշտ բյուջեից ցածր endpoint-ը վերադարձնում է հաջողություն և
  դատարկություն։ Մոնիտորինգը, որը հետևում է միայն ստատուս-կոդերին, սա չի
  նկատի։
- **Դատարկ պատասխանները ձեր error rate-ի մասն են։** Այս հետազոտության մեջ
  դրանք հաշվվել են որպես մերժումներ և մնում են ուշացման յուրաքանչյուր
  մետրիկայի հայտարարում։

## Ինչ սա չի հաստատում

Սա հզորության մասին պնդում չէ. միայն concurrency 1։ Որակի վճիռ չէ. գեյթերը
ծածկում են ձևաչափը, լեզուն և կրկնությունները, ոչ թե կոռեկտությունը։ Սարքի
մասին պնդում չէ. մեկ միավոր, պատկերի մեկ digest, մեկ արտեֆակտ։ Կրկնված է,
բայց ոչ ռեպլիկացված. մեկ միավորի վրա երեք չափված անցում մեկ ռեժիմին — հենց
դրա համար ապացույցների մակարդակը `lab_repeated` է, և operating envelope
այստեղ չի առաջարկվում։ Արժե՞ արդյոք մտորման անջատումը պատասխանների որակի
կորուստը — չի ստուգվել. հավանաբար այո, և դա առանձին որակավորում է։

## Ապացույցներ

Յուրաքանչյուր անցում ստեղծել է փաթեթ՝ ամբողջական ինքնությամբ մանիֆեստ,
գրառումներ յուրաքանչյուր հարցումի համար՝ ներառյալ մերժումները, գեյթերի
արդյունքներ, runtime-ի լոգ և ստուգիչ գումարների ֆայլ։ Հաշվետվության թվերը
նորից դուրս են բերվում այս գրառումներից SQL հարցումներով, որոնք գտնվում են
claims-ի կողքին. build-ն ընկնում է, եթե ռենդերված արժեքը դադարում է համընկնել
իր ապացույցի հետ։ Ինչպես է դա կառուցված — [ապացույցների և տվյալների](https://agmind.ai/hy/data/)
էջում։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
