# Промпт 2k против 32k: сколько длинный контекст стоит до первого токена

Почему старт с длинным документом настолько медленнее на локальном llama.cpp-сервере — и насколько?

Ожидание до первого токена растёт с длиной документа: модель читает всё, прежде чем сказать хоть что-то, и счёт за префилл масштабируется с прочитанным. Качество извлечения на этом ворклоаде держалось на обеих глубинах. Запасной выход — кеш промпта: повторяющийся префикс платит счёт один раз, поэтому второй вопрос по тому же документу возвращается почти мгновенно.

**Что было зафиксировано.** Один юнит, бэкенд, артефакт, квант и кампания; меняется только длина документа в промпте. Reasoning выключен, один поток.

| Метрика | Документ 2k токенов | Документ 32k токенов |
| --- | --- | --- |
| Время до первого токена, медиана | 1907 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.longctx.c1.ttft-2k-en/)) | 33965 ms ([lab_repeated](https://agmind.ai/ru/claims/strix.qwen36.longctx.c1.ttft-32k-en/)) |

## Ограничения

Измерено на 2k и 32k на одной модели и кванте — никаких заявлений за пределами 32k, и кривая между двумя точками не характеризована. Префилл-тяжёлые ворклоады на других бэкендах могут масштабироваться иначе.

## Связанные доказательства

- https://agmind.ai/ru/reports/llamacpp-prompt-cache-strix-halo/
- https://agmind.ai/ru/workloads/long-context-v1/

Every number above is re-derived from sealed run bundles in CI: https://agmind.ai/claims.json (CC BY 4.0).
Source page: https://agmind.ai/ru/compare/context-2k-vs-32k-qwen36-strix-halo/
