Отчёт

Мультислотный LLM-инференс на Strix Halo — legacy-результаты

Что делает один мини-ПК Strix Halo со 128 ГБ под 32 параллельными чат-потоками: рецепты, обрыв конкурентности после 8 запросов во всех конфигурациях, и где спекулятивное декодирование перестаёт помогать.

legacy internal research 31 июля 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Уровень доказательств: legacy. Эти замеры сделаны до методологии v1: на собственном стенде лаборатории, с пинеными digest’ами образов, солёными некэшируемыми промптами и в основном медианами трёх прогонов — но без пререгистрации, без репликации на втором юните и на более старом софте (ядро 6.17 против нынешнего выровненного 7.0). Цифры ниже — цитаты из публичного репозитория, а не значения из claim registry лаборатории. Флагманское исследование перемеряет эту область по методологии v1.

Источник (рецепты, харнессы, сырые данные прогонов): github.com/botAGI/strix-halo-multislot (MIT) · Развёрнутый рассказ: статья на Хабре

Что тестировалось

Один Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S gfx1151, 128 ГБ unified LPDDR5X), многопользовательский чат на llama.cpp server-vulkan с пиненым digest образа. Нагрузка — по сети с соседнего узла; метрики — из серверных timings; агрегат = Σ predicted-токенов / makespan. В репо опубликованы скрипты запуска, харнессы и полные таблицы — включая провалы и три собственных ранних вывода, опровергнутых более аккуратными замерами.

Ключевые исторические результаты (цитаты из репо)

СценарийКонфигурацияРезультат из репо
Мультипользовательский чат, скринингGemma 4 26B A4B, 32 клиента236 tok/s суммарно, ~7 tok/s на запрос
Endurance, 30 минутта же226 tok/s в среднем, 78°C, без троттлинга
Мультипользовательский QwenQwen3.6-35B-A3B Q4_0, 32 клиента178 tok/s суммарно (медиана 3)
Один поток + MTP-драфтQwen3.6 UD-Q4_K_M~90 tok/s на поток (медиана 3)

Находки, которые стоит знать (в рамках этого стенда)

  1. Обрыв производительности сразу после 8 параллельных запросов проявился во всех четырёх конфигурациях — в обеих архитектурах и всех трёх квантах. Модель определяла глубину провала и форму восстановления. Первопричина не установлена (профилирования ядер не было); практическое лечение, измеренное для одной модели (ограничение активных слотов), второй модели навредило бы.
  2. Спекулятивное декодирование (MTP) выигрывало в один поток и проигрывало под нагрузкой в измеренных точках — кроссовер, который вендорские материалы с их крупными выигрышами MTP на других стеках не предсказали бы.
  3. Кванты не взаимозаменяемы под конкурентностью, а ранний вывод о «лучшем» кванте из одиночного прогона был опровергнут повторами — опубликовано в репо как отвергнутая гипотеза.
  4. Набор из четырёх параметров ядра дал измеримый прирост генерации в reboot-A/B; вклад отдельных параметров сознательно не заявлялся.
  5. --parallel в llama.cpp по умолчанию auto (4 слота в тестированных билдах) — сервер, запущенный «на одного», уже мультислотный. Сравнение конфигов по флагам чуть не породило ложную находку; источник истины — /props → total_slots.

Чего эти данные не устанавливают

Ни клиентского TTFT (только серверные timings, очередь не учтена), ни оценки качества конфигураций, ни репликации на втором юните, ни обобщения за пределы этой коробки, digest’а и ядра. Флагманское исследование (см. пререгистрацию после публикации) закрывает ровно эти пробелы.

Как цитировать

AGmind Systems Lab (2026-07-31). Мультислотный LLM-инференс на Strix Halo — legacy-результаты. Evidence level: legacy. https://agmind.ai/ru/reports/strix-halo-multislot-legacy/
← Отчёты