# Prompt cache-ը միացրած/անջատած. երկրորդ հարցը նույն փաստաթղթի շուրջ

Երկրորդ հարցը նույն տեղադրված փաստաթղթի շուրջ նորի՞ց է վճարում ամբողջ prefill-ը լոկալ llama.cpp սերվերի վրա։

Քեշը միացրած՝ երկրորդ հարցը մեծ փաստաթղթի շուրջ պատասխանում է վայրկյանից պակասում; անջատած՝ սեսիան նորից է վճարում ամբողջ կիսարոպեանոց prefill-ը։ «Տեղադրիր փաստաթուղթը — հարցրու» սցենարների համար այս դրոշն ինտերակտիվ գործիքի և ոչ պիտանիի տարբերությունն է։

**Ինչն էր ֆիքսված։** Նույն յունիթը, backend-ը, արտեֆակտը; հարցազույգերը կիսում են բայթ առ բայթ նույնական փաստաթղթի պրեֆիքսը։ Փոխվում է միայն սերվերի prompt-cache դրոշը։

| Մետրիկա | Քեշը միացրած | Քեշն անջատած |
| --- | --- | --- |
| TTFT, երկրորդ հարցը նույն 32k փաստաթղթի շուրջ | 860 ms ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.docsession.c1.ttft-q2-32k-cache/)) | 33728 ms ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.docsession.c1.ttft-q2-32k-nocache/)) |
| TTFT. երկրորդ հարցը 8k փաստաթղթի շուրջ (քեշը միացրած)՝ ընդդեմ առաջին հարցի թարմ 32k փաստաթղթի շուրջ | 660 ms ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.docsession.c1.ttft-q2-8k-cache/)) | 33940 ms ([lab_repeated](https://agmind.ai/hy/claims/strix.qwen36.docsession.c1.ttft-q1-32k/)) |

## Սահմանափակումներ

Միայն բայթ առ բայթ նույնական պրեֆիքսներ — այլ կամ խմբագրված փաստաթղթի համար քեշն ոչինչ չի գնում։ Մեկ օգտատեր, մեկ հոսք; քեշի մեկուսացումն օգտատերերի միջև չի չափվել։

## Առնչվող ապացույցներ

- https://agmind.ai/hy/reports/llamacpp-prompt-cache-strix-halo/
- https://agmind.ai/hy/workloads/doc-session-v1/
- https://agmind.ai/hy/tested-configurations/strix-halo-qwen36-llamacpp-vulkan-docsession/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/hy/compare/prompt-cache-on-vs-off-doc-session/
