# 2k պրոմպտն ընդդեմ 32k-ի. որքան արժե երկար կոնտեքստը մինչև առաջին թոքենը

Ինչո՞ւ է երկար փաստաթղթով սկսելն այդքան ավելի դանդաղ լոկալ llama.cpp սերվերի վրա, և որքանո՞վ։

Սպասումը մինչև առաջին թոքենն աճում է փաստաթղթի երկարության հետ. մոդելը կարդում է ամեն ինչ՝ նախքան որևէ բան ասելը, և prefill-ի հաշիվը մասշտաբավորվում է կարդացածով։ Որոնման որակն այս workload-ի վրա պահվեց երկու խորության վրա էլ։ Փրկօղակը prompt cache-ն է. կրկնվող պրեֆիքսը հաշիվը վճարում է մեկ անգամ, դրա համար նույն փաստաթղթի շուրջ երկրորդ հարցը վերադառնում է գրեթե ակնթարթորեն։

**Ինչն էր ֆիքսված։** Նույն յունիթը, backend-ը, արտեֆակտը, քվանտը և արշավը; փոխվում է միայն փաստաթղթի երկարությունը պրոմպտում։ Reasoning-ն անջատած, մեկ հոսք։

| Մետրիկա | 2k թոքենանոց փաստաթուղթ | 32k թոքենանոց փաստաթուղթ |
| --- | --- | --- |
| Ժամանակ մինչև առաջին թոքենը, մեդիան | 1907 ms ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.longctx.c1.ttft-2k-en/)) | 33965 ms ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.longctx.c1.ttft-32k-en/)) |

## Սահմանափակումներ

Չափված է 2k և 32k կետերում մեկ մոդելի ու քվանտի վրա — ոչ մի պնդում 32k-ից այն կողմ, և երկու կետի միջև կորը բնութագրված չէ։ Prefill-ով ծանր workload-ներն այլ backend-ների վրա կարող են այլ կերպ մասշտաբավորվել։

## Առնչվող ապացույցներ

- https://agmind.ai/hy/reports/llamacpp-prompt-cache-strix-halo/
- https://agmind.ai/hy/workloads/long-context-v1/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/hy/compare/context-2k-vs-32k-qwen36-strix-halo/
