Колонка

Агентный кодинг — это префилл, а все покупают декод

Спросите, сколько токенов в секунду нужно локальному кодящему агенту, — каждый ответ будет про темп декода. Но ход агента — это огромный промпт и короткий ответ: ожидание живёт в префилле, и разговор о железе оптимизирует не ту половину запроса.

мнение 1 сентября 2026 г.

Это колонка-мнение, а не результат лаборатории. Цифры здесь — из рабочего журнала автора и цитируемых внешних источников (помечены в тексте), никогда — из реестра клеймов. Измеренные результаты с доказательствами живут в /claims/.

Каждую неделю кто-нибудь спрашивает, сколько токенов в секунду нужно локальному кодящему агенту, и каждую неделю ответы цитируют темп декода. Это не та половина запроса. Посмотрите, что агент реально отправляет: системный промпт, манифест инструментов, содержимое файлов, вывод сборки, историю разговора — десятки тысяч токенов контекста, — а следом ответ, который нередко умещается в один вызов инструмента. Генерация — погрешность округления. Работа — это чтение.

Это чтение и есть префилл, и ведёт он себя совсем не как декод. Декод — ровная капель, за которой можно наблюдать; префилл — стена, за которой стоишь и ждёшь, пока появится первый токен. На нашей коробке со 128 ГБ вопрос по документу на 32 тысячи токенов стоит десятков секунд префилла до первого видимого символа — точная цифра, измеренная, лежит в сравнении контекстов, — а декод после этого бежит быстрее, чем кто-либо читает. Кодящий агент платит примерно такую стену на каждом ходу, где его контекст поменялся. Купите железо по числу декода — и вы оптимизировали ту часть хода, в которой агент проводит меньше всего времени.

Прежде чем стать лучше, будет хуже. Reasoning-модели ставят вторую стену за первой: после префилла модель думает, и поток размышлений адресован не вам. Мы измерили, как двухсотмиллисекундное первое слово превращается в двадцатисекундное при включённом режиме размышлений — пара цифр лежит в отчёте про thinking, — и агент, оставивший размышления включёнными по умолчанию, платит обе стены, каждый ход, в основном за задачи с проверяемыми ответами, где наши гейты показали: размышления не купили ничего.

Теперь хорошая часть — потому что она есть, и это самый недооценённый рычаг локального инференса: кеш префикса. Контекст агента не случаен: тот же системный промпт, тот же манифест инструментов, те же шапки файлов, ход за ходом, с изменениями в хвосте. Сервер, который кеширует общий префикс, платит за стену один раз и остаток сессии едет бесплатно. Мы измерили разницу между «платить» и «ехать» — второй вопрос возвращается почти сразу, — а условие, которого это требует, жестоко своей простотой: префикс обязан совпадать байт в байт. Один перетасованный чанк ретривера, одна метка времени в системном промпте — и каждый ход платит полную цену, пока дашборд показывает здоровый кеш.

А это переворачивает вопрос о железе целиком. Для агентного кодинга значение имеют пропускная способность префилла и — прежде всего остального — то, держат ли ваш агентский фреймворк и сервер префикс достаточно стабильным, чтобы его кешировать. Середнячок с дисциплинированной раскладкой контекста по ощущениям обгонит монстра, чей фреймворк переписывает промпт каждый ход. Это свойство софта, переодетое в костюм железа, — потому ни один обзор видеокарт о нём не расскажет.

Поэтому перед покупкой — измерьте один настоящий ход агента на коробке, которая уже стоит у вас: первый видимый токен, а не первый токен размышлений, на каждый ход, с вашими реальными размерами контекста. Метод расписан. Если проблема окажется в ожидании, сперва посмотрите, что ваш стек делает с префиксом, и только потом — на цены карты побольше. Стена настоящая. Просто половина тех, кто в неё упирается, сложила её своими руками.

← Все колонки