# Кэш промптов вкл/выкл: второй вопрос по тому же документу

Платит ли второй вопрос по тому же вставленному документу полный префилл заново на локальном llama.cpp-сервере?

С включённым кэшем второй вопрос по большому документу отвечает менее чем за секунду; с выключенным — сессия заново платит полный полуминутный префилл. Для сценариев «вставил документ — спрашиваю» этот флаг — разница между интерактивным инструментом и непригодным.

**Что было зафиксировано.** Один юнит, бэкенд, артефакт; пары вопросов делят бит-в-бит одинаковый префикс документа. Меняется только серверный флаг кэша промптов.

| Метрика | Кэш включён | Кэш выключен |
| --- | --- | --- |
| TTFT, второй вопрос по тому же документу 32k | 860 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.docsession.c1.ttft-q2-32k-cache/)) | 33728 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.docsession.c1.ttft-q2-32k-nocache/)) |
| TTFT: второй вопрос по документу 8k (кэш вкл) против первого вопроса по свежему документу 32k | 660 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.docsession.c1.ttft-q2-8k-cache/)) | 33940 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.docsession.c1.ttft-q1-32k/)) |

## Ограничения

Только бит-в-бит одинаковые префиксы — для другого или отредактированного документа кэш не покупает ничего. Один пользователь, один поток; изоляция кэша между пользователями не мерялась.

## Связанные доказательства

- https://agmind.ai/ru/reports/llamacpp-prompt-cache-strix-halo/
- https://agmind.ai/ru/workloads/doc-session-v1/
- https://agmind.ai/ru/tested-configurations/strix-halo-qwen36-llamacpp-vulkan-docsession/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/ru/compare/prompt-cache-on-vs-off-doc-session/
