# Ollama Strix Halo-ի վրա (Ryzen AI Max+ 395). տեղադրում, GPU-ի դետեկտ, առաջին մոդելը

> Ollama-ի տեղադրումը Strix Halo տուփի վրա լռելյայն ուղով և բոլորին շփոթեցնող լոգ-տողի վերծանումը. ինչու է Vulkan ուղին դեն նետում ձեր iGPU-ն, ինչու է ROCm-ը, միևնույն է, վերցնում այն, և ինչպես ստուգել, որ մոդելն իրոք նստել է GPU-ի վրա, ոչ թե լուռ աշխատում է CPU-ի վրա։

- Published: 2026-09-01
- Platform: Strix Halo (Ryzen AI Max+ 395)
- Time to complete: 20 րոպե
- Canonical: https://agmind.ai/hy/guides/ollama-strix-halo/

Ollama-ն ամենաարագ ճանապարհն է այս սարքաշարի վրա պատասխանող մոդել
ստանալու, և տեղադրումն այստեղ իսկապես լռելյայն ուղին է. մեկ սկրիպտ, մեկ
pull, մեկ run։ Ընդհանուր տուտորիալները բաց են թողնում հենց այն մասը, որ
հատուկ է այս մեքենային. ինչ է իրականում տպում GPU-ի դետեկտը
Ryzen AI Max+ 395-ի վրա, այդ տողերից որն է թակարդ, և ինչպես համոզվել,
որ մոդելը նստել է GPU-ի վրա։ Այս տեքստը գրել ենք՝ տեղադրումը կատարելով
մեր սեփական տուփերից մեկի վրա; ներքևի լոգ-տողերն իրական են։

Եթե կառավարվող լռելյայնի փոխարեն ուզում եք լիարժեք վերահսկողություն
դրոշների, կոնտեքստի և ամրագրված տարբերակների վրա — դա
[llama.cpp ուղեցույցն է](https://agmind.ai/hy/guides/deploy-llm-strix-halo/). Ollama-ն
տակից աշխատեցնում է llama.cpp, իսկ
[որ շերտում աշխատել](https://agmind.ai/hy/reports/which-inference-engine-local-llm/)՝
առանձին հարց է։

## Քայլ 0 — հիշողության առաստաղը, ինչպես միշտ

Ամեն ինչից առաջ. գլխավոր համակարգային պահանջն այստեղ ոչ թե
դիստրիբուտիվի տարբերակն է, այլ հիշողության առաստաղը։ Linux-ի վրա, թե
որքան հիշողություն է հասանելի GPU-ին, որոշում է միջուկի TTM պարամետրը,
ոչ թե BIOS-ը։ Եթե դա բաց եք թողել, մեծ մոդելները կհրաժարվեն
տեղավորվել՝ ինչ runtime էլ օգտագործեք —
[հիշողության հատկացման էջը](https://agmind.ai/hy/reports/strix-halo-memory-allocation/)
դա բացատրում է։ Ճիշտ արվածի դեպքում Ollama-ն գործարկման պահին կհայտնի
ամբողջ առաստաղը; մեր լոգում մեքենայի ամբողջ RAM-ից մի փոքր պակաս է։

## Քայլ 1 — տեղադրում

Պաշտոնական ուղին այս սարքաշարի վրա աշխատում է.

```
curl -fsSL https://ollama.com/install.sh | sh
```

Պատրաստվեք բազմագիգաբայթանոց ներբեռնման — փաթեթը կրում է CPU, CUDA, ROCm և
Vulkan backend-ները։ Սկրիպտը գրանցում է systemd ծառայություն և
անմիջապես գործարկում այն։ Ստուգեք.

```
ollama --version
systemctl is-active ollama
```

## Քայլ 2 — GPU-ի դետեկտը կարդացեք տեղացու պես, ոչ թե բագ-ռեպորտ գրողի

Հենց այստեղ է այս մեքենան տարբերվում տուտորիալներից։ Նայեք, թե ինչ է
տեսել ծառայությունը.

```
journalctl -u ollama -n 80 | grep -iE "gpu|rocm|gfx|compute"
```

Մեր տուփի վրա թարմ տեղադրումը տպում է երկու տող, որոնք հակասական են
թվում.

```
msg="dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1"
     id=0 library=Vulkan name=Vulkan0 description="AMD Radeon Graphics (RADV GFX1151)"
msg="inference compute" id=0 library=ROCm compute=gfx1151
     description="Radeon 8060S Graphics" type=iGPU total="117.4 GiB" available="117.4 GiB"
```

Վերծանում. Ollama-ի **Vulkan** ուղին ինտեգրված GPU-ները լռելյայն դեն է
նետում — հենց առաջին տողի պատճառով են մարդիկ գնում issue-թրեքեր՝
համոզված, որ Ollama-ն չի տեսնում իրենց AMD վիդեոքարտը։ Բայց
ներկառուցված **ROCm** backend-ը gfx1151-ը ճանաչում է ուղղակիորեն և
վերցնում է սարքը՝ հիշողության ամբողջ առաստաղը տեսանելի։ Արդի Ollama-ի
վրա այս սարքաշարը ROCm-ի միջոցով աշխատում է անմիջապես;
`OLLAMA_IGPU_ENABLE=1` պետք է միայն, եթե ուզում եք հենց Vulkan ուղին։
Եթե ձեր լոգում կա drop տողը և ROCm տող *չկա*, ձեր Ollama-ն ավելի հին է,
քան ներկառուցված gfx1151 աջակցությունը — թարմացրեք այն, նախքան որևէ այլ
բանի դիպչելը։

## Քայլ 3 — pull և գործարկում

```
ollama pull llama3.2:3b
ollama run llama3.2:3b "Reply with one short sentence: what is inference?"
```

Սկսեք փոքր մոդելից՝ pipeline-ը վավերացնելու համար; չափսը մեծացրեք
հետո։ Թե ինչ է իրականում տեղավորվում այս մեքենայի հիշողության դասում՝
[չափված հարց է](https://agmind.ai/hy/reports/what-128gb-unified-memory-runs/)։

## Քայլ 4 — ապացուցեք, որ մոդելը նստել է GPU-ի վրա

Ստուգումը, որը գրեթե ոչ ոք չի գործարկում, — և ամենակարևորը iGPU
մեքենայի վրա, որտեղ լուռ CPU-fallback-ը տալիս է հավանական թվացող, բայց
դանդաղ վարք.

```
ollama ps
```

`PROCESSOR` սյունը պարտավոր է ցույց տալ `100% GPU`։ Մերը ցույց է
տալիս։ `XX%/XX% CPU/GPU`-ի նման որևէ բան նշանակում է, որ մոդելի մի
մասը դուրս է թափվել — չտեղավորվեց քայլ 0-ում կարգավորած առաստաղում,
կամ GPU-ն ընդհանրապես չի վերցվել։ CPU-ի վրա «աշխատող» մոդելը դասական
[կանաչ-բայց-կոտրված վիճակն է](https://agmind.ai/hy/essays/dashboard-lies-both-directions/).
պատասխանները գալիս են, ամեն ինչ նորմալ է թվում, իսկ դուք լուռ ստանում
եք ընդամենը մի մասնաբաժինն այն ամենի, ինչի ընդունակ է տուփը։

Արժե նաև իմանալ. Ollama-ն իր լռելյայն կոնտեքստը չափում է հայտնաբերված
հիշողությունից (մերն ինքնուրույն ընտրեց վեցանիշ թոքենային պատուհան),
իսկ պարապ մոդելները բեռնաթափում է մի քանի րոպե անց — `ollama ps`-ի
`UNTIL` սյունը հենց այդ հետհաշվարկն է, ոչ թե սխալ։

## Որտեղ է այս ուղին ավարտվում

Ollama-ի լռելյայն արժեքներն ընտրված են հարմարության համար և
թողարկումների միջև շարժվում են։ Այն օրը, երբ ուզենաք որևէ բան *չափել* —
կամ ձեր թվերը չհամընկնեն ուրիշների հետ, — անցեք սերվերին հարցնելուն, թե
ինչ է իրականում աշխատեցնում, և ամրագրելուն, թե ինչ եք տեղակայում.
[այդ կարգապահության մեջ է ամբողջ տարբերությունը](https://agmind.ai/hy/reports/how-to-benchmark-local-llm/)
սետապի և կոնֆիգուրացիայի միջև։ Թիմ սպասարկելու համար հիշեք
[զուգահեռության սանդուղքը](https://agmind.ai/hy/reports/concurrency-capacity-strix-halo/);
Ollama-ն լռելյայն գալիս է մեկ զուգահեռ slot-ով։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
