Контролируемое сравнение

Промпт 2k против 32k: сколько длинный контекст стоит до первого токена

Почему старт с длинным документом настолько медленнее на локальном llama.cpp-сервере — и насколько?

Ожидание до первого токена растёт с длиной документа: модель читает всё, прежде чем сказать хоть что-то, и счёт за префилл масштабируется с прочитанным. Качество извлечения на этом ворклоаде держалось на обеих глубинах. Запасной выход — кеш промпта: повторяющийся префикс платит счёт один раз, поэтому второй вопрос по тому же документу возвращается почти мгновенно.

Что было зафиксировано

Один юнит, бэкенд, артефакт, квант и кампания; меняется только длина документа в промпте. Reasoning выключен, один поток.

Метрика Документ 2k токенов Документ 32k токенов
Время до первого токена, медиана 1907мсmedian over valid 2k-band requests · lab_repeated · доказательства 33965мсmedian over valid 32k-band requests · lab_repeated · доказательства

Ограничения

Измерено на 2k и 32k на одной модели и кванте — никаких заявлений за пределами 32k, и кривая между двумя точками не характеризована. Префилл-тяжёлые ворклоады на других бэкендах могут масштабироваться иначе.

Отвечаете на этот вопрос где-то? Вставьте таблицу

Markdown, рендерится на GitHub / Reddit / форумах. Строка атрибуции внутри — данные CC BY 4.0, забирайте.

Связанные доказательства

← Все сравнения