# Мультислотный LLM-инференс на Strix Halo — legacy-результаты

> Что делает один мини-ПК Strix Halo со 128 ГБ под 32 параллельными чат-потоками: рецепты, обрыв конкурентности после 8 запросов во всех конфигурациях, и где спекулятивное декодирование перестаёт помогать.

- Published: 2026-07-31
- Evidence level: legacy
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/strix-halo-multislot-legacy/

> **Уровень доказательств: `legacy`.** Эти замеры сделаны до методологии v1: на
> собственном стенде лаборатории, с пинеными digest'ами образов, солёными
> некэшируемыми промптами и в основном медианами трёх прогонов — но без
> пререгистрации, без репликации на втором юните и на более старом софте
> (ядро 6.17 против нынешнего выровненного 7.0). Цифры ниже — цитаты из
> публичного репозитория, а не значения из claim registry лаборатории.
> Флагманское исследование перемеряет эту область по методологии v1.

**Источник (рецепты, харнессы, сырые данные прогонов):**
[github.com/botAGI/strix-halo-multislot](https://github.com/botAGI/strix-halo-multislot) (MIT)
· Развёрнутый рассказ: [статья на Хабре](https://habr.com/ru/articles/1060520/)

## Что тестировалось

Один Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S gfx1151, 128 ГБ unified
LPDDR5X), многопользовательский чат на llama.cpp `server-vulkan` с пиненым
digest образа. Нагрузка — по сети с соседнего узла; метрики — из серверных
`timings`; агрегат = Σ predicted-токенов / makespan. В репо опубликованы
скрипты запуска, харнессы и полные таблицы — включая провалы и три собственных
ранних вывода, опровергнутых более аккуратными замерами.

## Ключевые исторические результаты (цитаты из репо)

| Сценарий | Конфигурация | Результат из репо |
|---|---|---|
| Мультипользовательский чат, скрининг | Gemma 4 26B A4B, 32 клиента | 236 tok/s суммарно, ~7 tok/s на запрос  |
| Endurance, 30 минут | та же | 226 tok/s в среднем, 78°C, без троттлинга  |
| Мультипользовательский Qwen | Qwen3.6-35B-A3B Q4_0, 32 клиента | 178 tok/s суммарно (медиана 3)  |
| Один поток + MTP-драфт | Qwen3.6 UD-Q4_K_M | ~90 tok/s на поток (медиана 3)  |

## Находки, которые стоит знать (в рамках этого стенда)

1. **Обрыв производительности сразу после 8 параллельных запросов проявился во
   всех четырёх конфигурациях** — в обеих архитектурах и всех трёх квантах.
   Модель определяла глубину провала и форму восстановления. Первопричина не
   установлена (профилирования ядер не было); практическое лечение, измеренное
   для одной модели (ограничение активных слотов), второй модели навредило бы.
2. **Спекулятивное декодирование (MTP) выигрывало в один поток и проигрывало
   под нагрузкой** в измеренных точках — кроссовер, который вендорские
   материалы с их крупными выигрышами MTP на других стеках не предсказали бы.
3. **Кванты не взаимозаменяемы под конкурентностью**, а ранний вывод о «лучшем»
   кванте из одиночного прогона был опровергнут повторами — опубликовано в
   репо как отвергнутая гипотеза.
4. **Набор из четырёх параметров ядра дал измеримый прирост генерации** в
   reboot-A/B; вклад отдельных параметров сознательно не заявлялся.
5. **`--parallel` в llama.cpp по умолчанию auto (4 слота в тестированных
   билдах)** — сервер, запущенный «на одного», уже мультислотный. Сравнение
   конфигов по флагам чуть не породило ложную находку; источник истины —
   `/props → total_slots`.

## Чего эти данные не устанавливают

Ни клиентского TTFT (только серверные `timings`, очередь не учтена), ни оценки
качества конфигураций, ни репликации на втором юните, ни обобщения за пределы
этой коробки, digest'а и ядра. Флагманское исследование (см. пререгистрацию
после публикации) закрывает ровно эти пробелы.

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
