Короткая версия: за три непрерывных часа обслуживания на двух одинаковых юнитах темп, который эта коробка показала в первые минуты, — тот же темп, что и на третьем часе. «Рывок, потом увядание», предсказанный скептиками, так и не случился ни на одном из юнитов. Стенд, цифра дрейфа и её честные ограничения — ниже.
Спросите на форуме, может ли мини-ПК обслуживать языковую модель весь день, — ответ прилетит раньше, чем вы допишете вопрос: будет троттлить. Маленький корпус, общий радиатор, длительная нагрузка — физический аргумент пишет себя сам. Чего в этом ответе не бывает никогда, так это измерения. Мы его провели: три часа непрерывного обслуживания, без пауз, на двух серийно одинаковых юнитах — и сравнили последние пять минут машины с первыми.
Стенд
Два юнита Beelink GTR9 Pro, в каждом Ryzen AI Max+ 395 и 128 ГБ unified-памяти, на каждом llama.cpp server на бэкенде Vulkan, сборка запинена по digest образа, модель — Qwen3.6-35B-A3B Q4_K_M, запиненная по хэшу артефакта. Замкнутая нагрузка при конкурентности четыре: едва запрос завершился, стартует следующий, четыре полосы в каждый момент времени, 180 минут подряд. Reasoning выключен. Каждый запрос судят обычные гейты, отказы остаются в знаменателе.
Сначала честная странность: в id ворклоада написано endurance-30m-v1,
потому что исходной контрольной точкой были тридцать минут. Сам проход идёт
три часа. Id остаётся: переименование идентичностей ворклоадов посреди
архива — верный способ сделать опубликованные цифры непрослеживаемыми.
Троттлит ли Strix Halo под длительной LLM-нагрузкой?
Темп декода держался на 30.0мс/токенsingle_run на всём проходе. Дрейф между первыми пятью минутами и минутами со 175-й по 180-ю — та самая величина, которую аргумент про троттлинг предсказывает большой, — составил 1.6%single_run по объединённым данным обоих юнитов.
Завершаемость рассказывает ту же историю: 100.0% запросовsingle_run запросов за весь проход вернулись с полным непустым ответом. Ни медленного угасания, ни затыка посреди прогона, ни тихих обрезаний, подкрадывающихся по мере прогрева корпуса. Оба юнита, одна и та же форма.
Дрейф темпа декода — это троттлинг?
Клейм уже, чем «Strix Halo не троттлит», и разница существенна. Один трёхчасовой проход на юнит, один корпус, один уровень конкурентности, одна модель; температура в помещении не инструментировалась. Комната пожарче, конкурентность потяжелее, ворклоад поплотнее — всё это может сдвинуть результат; температуры кристалла из прогона задокументированы в заметках к нему для всех, кто хочет спорить с термикой напрямую.
Что измерение устанавливает: под этой обслуживающей нагрузкой темп, который коробка показывает на первой минуте, — это темп, который она показывает на третьем часе. Паттерн «рывок, потом увядание», предсказанный скептиками мини-ПК, не появился ни на одном из юнитов.
Чего это НЕ говорит
- Это не вердикт по термике. Мы меряли поведение при обслуживании, а не пределы кристалла. Паттерн воспроизвёлся на обоих юнитах; повторы внутри юнита впереди — поэтому у страницы уровень доказательности single-run.
- Конкурентность четыре — не произвольный выбор. Это рабочая точка из лестницы конкурентности — картина ожидания на одном, четырёх и восьми потоках описана в отдельном отчёте.
- Замкнутый цикл — худший случай для тепла, а не для реализма. Живые команды простаивают между сообщениями. Коробка, которая держит темп при нулевом простое, в рваном офисном режиме имеет запас, а не наоборот.
Вердикт по протестированной конфигурации — на карточке endurance; у каждой цифры есть постоянная страница со скоупом, ограничениями и сырыми доказательствами в реестре клеймов, а запечатанные бандлы прогонов — в публичном архиве.