# Ollama на Strix Halo (Ryzen AI Max+ 395): установка, детект GPU, первая модель

> Установка Ollama на коробке со Strix Halo дефолтным путём и расшифровка строки лога, которая путает всех: почему Vulkan-путь отбрасывает ваш iGPU, почему ROCm всё равно его подхватывает и как проверить, что модель действительно легла на GPU, а не тихо работает на CPU.

- Published: 2026-09-01
- Platform: Strix Halo (Ryzen AI Max+ 395)
- Time to complete: 20 мин
- Canonical: https://agmind.ai/ru/guides/ollama-strix-halo/

Ollama — кратчайший путь от голой коробки до модели, которая отвечает,
и установка здесь действительно дефолтный путь: один скрипт, один pull,
один run. Типовые туториалы пропускают ровно то, что специфично для этой
машины: что на самом деле печатает детект GPU на Ryzen AI Max+ 395,
какая из этих строк — ловушка и как убедиться, что модель легла на GPU.
Мы писали этот текст, выполняя установку на одной из собственных
коробок; строки лога ниже — настоящие.

Если вместо управляемого дефолта нужен полный контроль над флагами,
контекстом и запиненными версиями — это
[гайд по llama.cpp](https://agmind.ai/ru/guides/deploy-llm-strix-halo/): под капотом
Ollama гоняет llama.cpp, а
[на каком слое работать](https://agmind.ai/ru/reports/which-inference-engine-local-llm/) —
отдельный вопрос.

## Шаг 0 — потолок памяти, как всегда

Прежде всего остального: главное системное требование здесь — не версия
дистрибутива, а потолок памяти. На Linux то, сколько памяти доступно
GPU, решает TTM-параметр ядра, а не BIOS. Если вы его пропустили,
большие модели откажутся влезать при любом рантайме —
[страница про распределение памяти](https://agmind.ai/ru/reports/strix-halo-memory-allocation/)
разбирает это. Сделано правильно — и Ollama на старте отчитается о
полном потолке; у нас в логе стоит чуть меньше всей RAM машины.

## Шаг 1 — установка

Официальный путь на этом железе работает:

```
curl -fsSL https://ollama.com/install.sh | sh
```

Готовьтесь к многогигабайтной загрузке — бандл несёт бэкенды CPU, CUDA,
ROCm и Vulkan. Скрипт регистрирует systemd-сервис и сразу запускает его.
Проверьте:

```
ollama --version
systemctl is-active ollama
```

## Шаг 2 — расшифруйте детект GPU, прежде чем писать баг-репорт

Вот где эта машина расходится с туториалами. Посмотрите, что увидел
сервис:

```
journalctl -u ollama -n 80 | grep -iE "gpu|rocm|gfx|compute"
```

На нашей коробке свежая установка печатает две строки, которые выглядят
противоречиво:

```
msg="dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1"
     id=0 library=Vulkan name=Vulkan0 description="AMD Radeon Graphics (RADV GFX1151)"
msg="inference compute" id=0 library=ROCm compute=gfx1151
     description="Radeon 8060S Graphics" type=iGPU total="117.4 GiB" available="117.4 GiB"
```

Расшифровка: **Vulkan**-путь Ollama по умолчанию отбрасывает
интегрированные GPU — именно из-за первой строки люди идут в
issue-трекер с убеждением, что Ollama не видит их видеокарту AMD. Но
встроенный **ROCm**-бэкенд узнаёт gfx1151 напрямую и забирает устройство
себе — с полным потолком памяти на виду. На актуальной Ollama это железо
работает из коробки через ROCm; `OLLAMA_IGPU_ENABLE=1` нужен, только
если вам нужен именно Vulkan-путь. Если в вашем логе есть строка про
drop и *нет* строки ROCm — ваша Ollama старше встроенной поддержки
gfx1151; обновите её прежде, чем трогать что-либо ещё.

## Шаг 3 — pull и запуск

```
ollama pull llama3.2:3b
ollama run llama3.2:3b "Reply with one short sentence: what is inference?"
```

Начните с маленькой модели, чтобы провалидировать конвейер; размер
нарастите потом. Что реально влезает в класс памяти этой машины —
[измерено отдельно](https://agmind.ai/ru/reports/what-128gb-unified-memory-runs/).

## Шаг 4 — докажите, что модель легла на GPU

Проверка, которую почти никто не запускает, — и самая важная на машине
с iGPU, где тихий CPU-фоллбек даёт правдоподобное, но медленное
поведение:

```
ollama ps
```

Колонка `PROCESSOR` обязана показывать `100% GPU`. У нас показывает.
Что-нибудь вроде `XX%/XX% CPU/GPU` означает, что часть модели ушла на CPU —
не влезла в потолок из шага 0, либо GPU не подхватился вовсе. Модель,
«работающая» на CPU, — классическое
[зелёное-но-сломанное состояние](https://agmind.ai/ru/essays/dashboard-lies-both-directions/):
ответы приходят, всё выглядит нормально, а вы тихо получаете долю того,
на что способна коробка.

Ещё стоит знать: дефолтный контекст Ollama подбирает от обнаруженной
памяти (наша сама выбрала себе шестизначное окно в токенах), а
простаивающие модели выгружает через несколько минут — колонка `UNTIL`
в `ollama ps` и есть этот обратный отсчёт, а не ошибка.

## Где этот путь заканчивается

Дефолты Ollama выбраны ради удобства и переезжают между релизами. В
день, когда захотите что-то *измерить* — или ваши цифры разойдутся с
чужими, — начните спрашивать сервер, что он реально
запускает, и запинивать то, что деплоите:
[в этой дисциплине вся разница](https://agmind.ai/ru/reports/how-to-benchmark-local-llm/)
между сетапом и конфигурацией. Для обслуживания команды помните про
[лестницу конкурентности](https://agmind.ai/ru/reports/concurrency-capacity-strix-halo/);
из коробки Ollama идёт с одним параллельным слотом.

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
