Контролируемое сравнение
Промпт 2k против 32k: сколько длинный контекст стоит до первого токена
Почему старт с длинным документом настолько медленнее на локальном llama.cpp-сервере — и насколько?
Ожидание до первого токена растёт с длиной документа: модель читает всё, прежде чем сказать хоть что-то, и счёт за префилл масштабируется с прочитанным. Качество извлечения на этом ворклоаде держалось на обеих глубинах. Запасной выход — кеш промпта: повторяющийся префикс платит счёт один раз, поэтому второй вопрос по тому же документу возвращается почти мгновенно.
Что было зафиксировано
Один юнит, бэкенд, артефакт, квант и кампания; меняется только длина документа в промпте. Reasoning выключен, один поток.
| Метрика | Документ 2k токенов | Документ 32k токенов |
|---|---|---|
| Время до первого токена, медиана | 1907мсmedian over valid 2k-band requests · lab_repeated · доказательства | 33965мсmedian over valid 32k-band requests · lab_repeated · доказательства |
Ограничения
Измерено на 2k и 32k на одной модели и кванте — никаких заявлений за пределами 32k, и кривая между двумя точками не характеризована. Префилл-тяжёлые ворклоады на других бэкендах могут масштабироваться иначе.
Отвечаете на этот вопрос где-то? Вставьте таблицу
Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.