# Beelink GTR9 Pro под локальные нейросети: что показали два юнита за месяц обслуживания

> Обзоры гоняют эту коробку неделю. Мы купили две, заморозили ворклоады и с тех пор на них обслуживаем модели: рабочий софтовый стек, измеренные цифры, где два юнита сошлись — и то, за что мы всё ещё не ручаемся.

- Published: 2026-08-21
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/beelink-gtr9-pro-local-llm/

Два коммерчески одинаковых Beelink GTR9 Pro — Ryzen AI Max+ 395, 128 ГБ
unified-памяти LPDDR5X-8000, Radeon 8060S (gfx1151), два порта 10GbE — это
машины, на которых получено большинство цифр в нашем реестре клеймов. Эта
страница о том, чему научил месяц настоящего обслуживания на них: какой
софтовый стек работает, что коробка измеримо делает, где два юнита сошлись
и за что мы по-прежнему не ручаемся.

## Зачем две одинаковые коробки

Затем, что по одной коробке не понять, что вы измерили: свойство железа или причуду конкретного экземпляра. Со второй коробкой замер перестаёт быть байкой: один и тот же замороженный ворклоад, тот же запиненный
рантайм и артефакт модели, прогнанные на обеих. Клеймы уровня
`lab_unit_replicated` в нашем реестре — те, где картина повторилась на
обеих машинах; ровно это уровень и означает, и ровно поэтому у нас дубль, а не две разные коробки.

## Софтовый стек, который работает

Конфигурация, на которой сегодня работает наша обслуживающая нода, считана с
машины, а не с вики:

```
kernel   7.0.0-28-generic
Vulkan   RADV (GFX1151), Mesa 25.2.8
runtime  llama.cpp server, pinned by image digest
```

Обслуживаем мы по Vulkan через RADV. ROCm на этом железе тоже работает, и
оба бэкенда прошли все гейты корректности, которые мы перед ними ставили, —
разница вышла в темпе декода, а не в качестве, и
[сравнение бок о бок лежит на отдельной странице](https://agmind.ai/ru/compare/llamacpp-vulkan-vs-rocm-strix-halo/).
По сети: оба интерфейса 10GbE были подняты всё это время; Wi-Fi у нас
выключен — обслуживающему узлу радиолинк держать незачем.

Единственный пункт конфигурации, который стоит прочитать до покупки:
выделение памяти под Linux работает не так, как подсказывает меню BIOS, и
загрузятся ли большие модели, решает
[параметр ядра](https://agmind.ai/ru/reports/strix-halo-memory-allocation/), а не ползунок в
прошивке. Та страница существует потому, что сначала это стоило нам времени.

## Что коробка делает

MoE класса 35B на Q4_K_M, повседневные запросы, рассуждения выключены:
первый токен ответа за
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)), декод идёт
на **15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)). На четырёх
одновременных чатах ожидание первого слова становится
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)), на восьми —
**865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)), а
завершаемость держится на
**100.0 % of requests** ([strix.qwen36.interactive2.c8.completion-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.completion-nothink/)).

Структурированная автоматизация: задачи со строгим JSON выполнялись на
**100.0 % of requests** ([strix.qwen36.structured.c1.task-success-nothink](https://agmind.ai/claims/strix.qwen36.structured.c1.task-success-nothink/)). Поиск
по длинному контексту на документах до 32k токенов —
**100.0 % of requests** ([strix.qwen36.longctx.c1.needle-success](https://agmind.ai/claims/strix.qwen36.longctx.c1.needle-success/)), а счёт за
префилл на таком размере документа —
**33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)): именно эту цифру
и надо закладывать в документные процессы.

Полные измеренные таблицы лежат в
[репозитории бенчмарков](https://github.com/botAGI/strix-halo-llm-benchmarks),
а у каждой цифры есть постоянная страница в [реестре](https://agmind.ai/ru/claims/).

## Держит ли она как обслуживающий узел

Три непрерывных часа на конкурентности четыре сдвинули темп декода на
**1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/)), при медиане
**30.0 ms/token** ([strix.qwen36.endurance.c4.itl-median](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-median/)) — и так на обоих
юнитах, с одинаковой формой кривой.
[Отчёт о длительной нагрузке](https://agmind.ai/ru/reports/strix-halo-sustained-load-3-hours/) —
это длинная версия ответа на вопрос «уйдёт ли эта штука в троттлинг, если ею
действительно пользоваться».

Помимо замороженных тестов есть свидетельство помягче: один из юнитов на
момент написания держится больше недели непрерывной смешанной работы,
обслуживая модели, пока мы заняты другим. Аптайм — не бенчмарк, и мы его за
бенчмарк не выдаём, но коробка, которую надо нянчить, тихих недель не
набирает.

## За что мы не ручаемся

**Два юнита — не партия.** Всё выше описывает наши две машины.
Производственный разброс, ревизии и различия прошивок по всему тиражу —
ровно то, чего двумя образцами не измерить, и
[страница стендов](https://agmind.ai/ru/testbed/) называет этот предел прямо.

**Мы не проверяли её как десктоп.** Ни вывода на монитор, ни игр, ни
температур под графической нагрузкой на GPU: это обслуживающие узлы, и
мерили мы обслуживание.

**Никаких сравнений с коробками, которых у нас нет.** Тот же кремний ставят
и другие вендоры, а подборки, сравнивающие их между собой, легко писать и
невозможно проверить. Эту мы померили потому, что она у нас есть.

**Никаких советов по цене.** Цены на железо гуляют; лаборатория их не публикует.

## Если она у вас уже есть

Прогоните замороженные ворклоады сами —
[харнесс открыт](https://github.com/botAGI/agmind-bench), а
[контракт воспроизведения](https://agmind.ai/ru/reproduce/) означает, что подтверждённый
независимый прогон поднимает уровень доказательности клейма, а провалившийся
тоже публикуется. Второй, третий и четвёртый GTR9 Pro в чужих руках — вот что превратит «два юнита сошлись» во что-то покрепче, чем согласие двух юнитов.

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
