Уровень доказательств:
legacy. Эти замеры сделаны до методологии v1: на собственном стенде лаборатории, с пинеными digest’ами образов, солёными некэшируемыми промптами и в основном медианами трёх прогонов — но без пререгистрации, без репликации на втором юните и на более старом софте (ядро 6.17 против нынешнего выровненного 7.0). Цифры ниже — цитаты из публичного репозитория, а не значения из claim registry лаборатории. Флагманское исследование перемеряет эту область по методологии v1.
Источник (рецепты, харнессы, сырые данные прогонов): github.com/botAGI/strix-halo-multislot (MIT) · Развёрнутый рассказ: статья на Хабре
Что тестировалось
Один Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S gfx1151, 128 ГБ unified
LPDDR5X), многопользовательский чат на llama.cpp server-vulkan с пиненым
digest образа. Нагрузка — по сети с соседнего узла; метрики — из серверных
timings; агрегат = Σ predicted-токенов / makespan. В репо опубликованы
скрипты запуска, харнессы и полные таблицы — включая провалы и три собственных
ранних вывода, опровергнутых более аккуратными замерами.
Ключевые исторические результаты (цитаты из репо)
| Сценарий | Конфигурация | Результат из репо |
|---|---|---|
| Мультипользовательский чат, скрининг | Gemma 4 26B A4B, 32 клиента | 236 tok/s суммарно, ~7 tok/s на запрос |
| Endurance, 30 минут | та же | 226 tok/s в среднем, 78°C, без троттлинга |
| Мультипользовательский Qwen | Qwen3.6-35B-A3B Q4_0, 32 клиента | 178 tok/s суммарно (медиана 3) |
| Один поток + MTP-драфт | Qwen3.6 UD-Q4_K_M | ~90 tok/s на поток (медиана 3) |
Находки, которые стоит знать (в рамках этого стенда)
- Обрыв производительности сразу после 8 параллельных запросов проявился во всех четырёх конфигурациях — в обеих архитектурах и всех трёх квантах. Модель определяла глубину провала и форму восстановления. Первопричина не установлена (профилирования ядер не было); практическое лечение, измеренное для одной модели (ограничение активных слотов), второй модели навредило бы.
- Спекулятивное декодирование (MTP) выигрывало в один поток и проигрывало под нагрузкой в измеренных точках — кроссовер, который вендорские материалы с их крупными выигрышами MTP на других стеках не предсказали бы.
- Кванты не взаимозаменяемы под конкурентностью, а ранний вывод о «лучшем» кванте из одиночного прогона был опровергнут повторами — опубликовано в репо как отвергнутая гипотеза.
- Набор из четырёх параметров ядра дал измеримый прирост генерации в reboot-A/B; вклад отдельных параметров сознательно не заявлялся.
--parallelв llama.cpp по умолчанию auto (4 слота в тестированных билдах) — сервер, запущенный «на одного», уже мультислотный. Сравнение конфигов по флагам чуть не породило ложную находку; источник истины —/props → total_slots.
Чего эти данные не устанавливают
Ни клиентского TTFT (только серверные timings, очередь не учтена), ни оценки
качества конфигураций, ни репликации на втором юните, ни обобщения за пределы
этой коробки, digest’а и ядра. Флагманское исследование (см. пререгистрацию
после публикации) закрывает ровно эти пробелы.