# Քանի՞ թոքեն վայրկյանում է բավարար լոկալ LLM-ի համար

> Լոկալ AI-ի ամենահաճախ տրվող և ամենաքիչ չափված հարցը, որին սովորաբար պատասխանում են հորինված կլոր թվերով։ Ահա թե ինչ է արագությունն իրապես զգացվում իրական տուփի վրա. սպասումը մինչև առաջին օգտակար բառը, հոսքը դրանից հետո և ձախողումը, որը ցանկացած tok/s թիվ դարձնում է անիմաստ։

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/how-many-tokens-per-second-is-enough/

Ազնիվ պատասխանը. «բավարարը» մեկ թիվ չէ, որովհետև հարցի տակ թաքնված են
երեք առանձին փորձառություններ — որքան սպասել մինչև առաջին օգտակար բառը,
ինչ արագ է տեքստը հոսում դրանից հետո, և այն, թե ընդհանրապես կգա՞
պատասխան։ Ֆորումները պատասխանում են կլոր շեմերով, որոնք ոչ ոք չի չափել։
Ահա թե ինչ է ամեն փորձառությունն իրապես մեկ իրական տուփի վրա, որտեղ
ամեն թիվ կրում է իր կոնֆիգուրացիան։

## Ինչու է մեկ tok/s թիվը սխալ ոսպնյակ

Թողունակության մեկ թիվը միջինացնում է այն երկու բանը, որ մարդն իրապես
զգում է. դադարը, մինչև որևէ բան կհայտնվի, և տեմպը, երբ արդեն հայտնվել
է։ Միջին tok/s-ով նույնական երկու կարգավորում կարող են զգացվել
ակնթարթային կամ կոտրված՝ կախված նրանից, թե որտեղ է նստած ժամանակը։
Ավելի վատ. շրջանառվող ամենատարածված արագության թիվը — դեկոդի tok/s-ը
սինթետիկ բենչմարքից — իրական պրոմպտի տակ այս երկու փորձառությունից ոչ
մեկը չի չափում։ Ուստի հարցը բաժանեք այնպես, ինչպես ընկալումն է
բաժանում։

## Որքա՞ն սպասել մինչև առաջին օգտակար բառը

Առօրյա հարցումների վրա reasoning-ն անջատած՝ այս տուփն իր առաջին
պատասխան-թոքենը ցույց է տալիս
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/))-ում — այն
շեմից ցածր, որից սկսած մարդն ընդհանրապես սպասում է նկատում։ Նույն
մոդելը reasoning-ը միացրած մինչև առաջին տեսանելի բառը պահանջում է
**20191 ms** ([strix.qwen36.interactive2.c1.ttfa-thinking](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-thinking/)), մինչդեռ
*որևէ բանի* առաջին թոքենին հետևող միամիտ դաշբորդը կհաղորդեր
**212 ms** ([strix.qwen36.interactive2.c1.ttft-any-token](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttft-any-token/)) —
որովհետև մտորումների հոսքը մեկնարկում է ակնթարթորեն և ուղղված չէ ձեզ։
Եթե այս էջից մեկ մեթոդ եք տանելու. չափեք մինչև *պատասխանի* առաջին
թոքենը, այլապես
[ձեր մետրիկան ձեզ կստի](https://agmind.ai/hy/reports/ttft-thinking-model-strix-halo/)։

## Ինչ արագ պիտի հոսի պատասխանը

Ընթերցանության տեմպը բնական չափանիշն է. տեքստը, որը գալիս է ավելի
արագ, քան կարդում եք, զգացվում է սահուն, ավելի դանդաղը՝ որպես
թելադրություն։ Այս տուփը առօրյա կորպուսի վրա դեկոդում է
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/))-ով —
ընթերցանության տեմպից հանգիստ առաջ։ Կոնֆիգուրացիան այս թիվը շարժում է
ավելի շատ, քան սարքաշարային նախանձը. ավելի ծանր Q8_0 քվանտը
դանդաղեցնում է այն մինչև
**18.7 ms/token** ([strix.qwen36q8.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q8.vulkan.c1.itl-nothink/)), իսկ ROCm
backend-ը՝ մինչև
**18.7 ms/token** ([strix.qwen36q4.rocm.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.rocm.c1.itl-nothink/)) —
[քվանտի](https://agmind.ai/hy/compare/q4km-vs-q80-qwen36-strix-halo/) և
[backend-ի](https://agmind.ai/hy/compare/llamacpp-vulkan-vs-rocm-strix-halo/)
ընտրություններն ավելին արժեն, քան upgrade-ի պլանների մեծ մասը։

## Կդիմանա՞ արագությունը զուգահեռությանն ու ժամանակին

Մենակ, առաջին րոպեին վերցրած թվերը շոյում են տուփին։ Չորս միաժամանակյա
չաթի տակ առաջին պատասխան-թոքենը դեռ գալիս է
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/))-ում; ութի
դեպքում՝ **865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)) —
[ամբողջ սանդուղքը](https://agmind.ai/hy/reports/concurrency-capacity-strix-halo/) հենց
այն է, ինչով չափավորում են ընդհանուր տուփը։ Իսկ երեք ժամ շարունակական
սպասարկման ընթացքում դեկոդի տեմպը շեղվեց
**1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/))-ով —
արագություն, որը
[աշխատանքային օրվա հետ չի մարում](https://agmind.ai/hy/reports/strix-halo-sustained-load-3-hours/)։

## Երբ արագությունը դադարում է կարևոր լինել

Մոդելը կարող է արագ լինել և միևնույնն է ոչինչ չտալ. սեղմ
թոքեն-բյուջեով, reasoning-ը միացրած, այս տուփը հարցումների
**58.3 % of requests** ([strix.qwen36.interactive2.c1.answerless-1k](https://agmind.ai/claims/strix.qwen36.interactive2.c1.answerless-1k/))-ը
վերադարձրեց որպես HTTP 200՝ դատարկ պատասխանով — բյուջեն գնաց
մտորումների վրա, ձեզ՝ ոչինչ։ Մեկ այլ մոդելային ընտանիք իր կանխադրված
ռեժիմում նույն կորպուսի վրա ցույց տվեց
**8.3 % of requests** ([strix.gemma4.interactive2.c1.answerless-default](https://agmind.ai/claims/strix.gemma4.interactive2.c1.answerless-default/))։ Սա
ոչ մի tok/s թիվ չի բռնում, հենց դրա համար
[չափում ենք առանձին](https://agmind.ai/hy/reports/answerless-http-200/) — և հենց դրա
համար արագության խոսակցությունը, որ սա անտեսում է, թերի է։

## Ուրեմն ի՞նչ է «բավարարը»

Մենակ չաթի համար այս դասի սարքաշարի վրա. վերևի տուփն արդեն անցել է այն
կետը, որտեղ արագությունը խցանն է — առաջին բառը ընկալման շեմից ցածր,
հոսքը ընթերցանության տեմպից առաջ։ Ընդհանուր տուփի համար զուգահեռության
սանդուղքը կարդացեք ձեր օգտատերերի հանդուրժելիք սպասման դիմաց։
Ավտոմատացման համար մետրիկան ամբողջական ժամանակն է մեկ ավարտված,
*վերլուծելի* պատասխանի հաշվով —
[չափված այստեղ](https://agmind.ai/hy/reports/local-llm-json-reliability/)։ Իսկ
reasoning-ը միացրած ցանկացած կարգավորման համար նախ բյուջե դրեք խափանման
ռեժիմի, հետո՝ թողունակության համար։

Եթե որևէ էջ այս չափումների փոխարեն ձեզ առաջարկում է մեկ ունիվերսալ
tok/s շեմ, այն մեջբերում է տրամադրություն։ Ձեր սեփական տուփը չափելու
մեթոդը [գրված է այստեղ](https://agmind.ai/hy/reports/how-to-benchmark-local-llm/); վերևի
ամեն թիվ ունի մշտական էջ՝ հում գործարկումներով,
[ռեեստրում](https://agmind.ai/hy/claims/)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
