Мануал по развёртыванию
Ollama на Strix Halo (Ryzen AI Max+ 395): установка, детект GPU, первая модель
Установка Ollama на коробке со Strix Halo дефолтным путём и расшифровка строки лога, которая путает всех: почему Vulkan-путь отбрасывает ваш iGPU, почему ROCm всё равно его подхватывает и как проверить, что модель действительно легла на GPU, а не тихо работает на CPU.
- Платформа:
- Strix Halo (Ryzen AI Max+ 395)
- Время на прохождение:
- 20 мин
- Обновлено:
- 01.09.2026
Ollama — кратчайший путь от голой коробки до модели, которая отвечает, и установка здесь действительно дефолтный путь: один скрипт, один pull, один run. Типовые туториалы пропускают ровно то, что специфично для этой машины: что на самом деле печатает детект GPU на Ryzen AI Max+ 395, какая из этих строк — ловушка и как убедиться, что модель легла на GPU. Мы писали этот текст, выполняя установку на одной из собственных коробок; строки лога ниже — настоящие.
Если вместо управляемого дефолта нужен полный контроль над флагами, контекстом и запиненными версиями — это гайд по llama.cpp: под капотом Ollama гоняет llama.cpp, а на каком слое работать — отдельный вопрос.
Шаг 0 — потолок памяти, как всегда
Прежде всего остального: главное системное требование здесь — не версия дистрибутива, а потолок памяти. На Linux то, сколько памяти доступно GPU, решает TTM-параметр ядра, а не BIOS. Если вы его пропустили, большие модели откажутся влезать при любом рантайме — страница про распределение памяти разбирает это. Сделано правильно — и Ollama на старте отчитается о полном потолке; у нас в логе стоит чуть меньше всей RAM машины.
Шаг 1 — установка
Официальный путь на этом железе работает:
curl -fsSL https://ollama.com/install.sh | sh
Готовьтесь к многогигабайтной загрузке — бандл несёт бэкенды CPU, CUDA, ROCm и Vulkan. Скрипт регистрирует systemd-сервис и сразу запускает его. Проверьте:
ollama --version
systemctl is-active ollama
Шаг 2 — расшифруйте детект GPU, прежде чем писать баг-репорт
Вот где эта машина расходится с туториалами. Посмотрите, что увидел сервис:
journalctl -u ollama -n 80 | grep -iE "gpu|rocm|gfx|compute"
На нашей коробке свежая установка печатает две строки, которые выглядят противоречиво:
msg="dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1"
id=0 library=Vulkan name=Vulkan0 description="AMD Radeon Graphics (RADV GFX1151)"
msg="inference compute" id=0 library=ROCm compute=gfx1151
description="Radeon 8060S Graphics" type=iGPU total="117.4 GiB" available="117.4 GiB"
Расшифровка: Vulkan-путь Ollama по умолчанию отбрасывает
интегрированные GPU — именно из-за первой строки люди идут в
issue-трекер с убеждением, что Ollama не видит их видеокарту AMD. Но
встроенный ROCm-бэкенд узнаёт gfx1151 напрямую и забирает устройство
себе — с полным потолком памяти на виду. На актуальной Ollama это железо
работает из коробки через ROCm; OLLAMA_IGPU_ENABLE=1 нужен, только
если вам нужен именно Vulkan-путь. Если в вашем логе есть строка про
drop и нет строки ROCm — ваша Ollama старше встроенной поддержки
gfx1151; обновите её прежде, чем трогать что-либо ещё.
Шаг 3 — pull и запуск
ollama pull llama3.2:3b
ollama run llama3.2:3b "Reply with one short sentence: what is inference?"
Начните с маленькой модели, чтобы провалидировать конвейер; размер нарастите потом. Что реально влезает в класс памяти этой машины — измерено отдельно.
Шаг 4 — докажите, что модель легла на GPU
Проверка, которую почти никто не запускает, — и самая важная на машине с iGPU, где тихий CPU-фоллбек даёт правдоподобное, но медленное поведение:
ollama ps
Колонка PROCESSOR обязана показывать 100% GPU. У нас показывает.
Что-нибудь вроде XX%/XX% CPU/GPU означает, что часть модели ушла на CPU —
не влезла в потолок из шага 0, либо GPU не подхватился вовсе. Модель,
«работающая» на CPU, — классическое
зелёное-но-сломанное состояние:
ответы приходят, всё выглядит нормально, а вы тихо получаете долю того,
на что способна коробка.
Ещё стоит знать: дефолтный контекст Ollama подбирает от обнаруженной
памяти (наша сама выбрала себе шестизначное окно в токенах), а
простаивающие модели выгружает через несколько минут — колонка UNTIL
в ollama ps и есть этот обратный отсчёт, а не ошибка.
Где этот путь заканчивается
Дефолты Ollama выбраны ради удобства и переезжают между релизами. В день, когда захотите что-то измерить — или ваши цифры разойдутся с чужими, — начните спрашивать сервер, что он реально запускает, и запинивать то, что деплоите: в этой дисциплине вся разница между сетапом и конфигурацией. Для обслуживания команды помните про лестницу конкурентности; из коробки Ollama идёт с одним параллельным слотом.