Контролируемое сравнение
Кэш промптов вкл/выкл: второй вопрос по тому же документу
Платит ли второй вопрос по тому же вставленному документу полный префилл заново на локальном llama.cpp-сервере?
Что было зафиксировано
Один юнит, бэкенд, артефакт; пары вопросов делят бит-в-бит одинаковый префикс документа. Меняется только серверный флаг кэша промптов.
| Метрика | Кэш включён | Кэш выключен |
|---|---|---|
| TTFT, второй вопрос по тому же документу 32k | 860мсmedian over valid requests for this item · lab_repeated · доказательства | 33728мсmedian over valid requests for this item · lab_repeated · доказательства |
| TTFT: второй вопрос по документу 8k (кэш вкл) против первого вопроса по свежему документу 32k | 660мсmedian over valid requests for this item · lab_repeated · доказательства | 33940мсmedian over valid requests for this item · lab_repeated · доказательства |
Как это читать
С включённым кэшем второй вопрос по большому документу отвечает менее чем за секунду; с выключенным — сессия заново платит полный полуминутный префилл. Для сценариев «вставил документ — спрашиваю» этот флаг — разница между интерактивным инструментом и непригодным.
Ограничения
Только бит-в-бит одинаковые префиксы — для другого или отредактированного документа кэш не покупает ничего. Один пользователь, один поток; изоляция кэша между пользователями не мерялась.
Отвечаете на этот вопрос где-то? Вставьте таблицу
Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.