Տեղակայման ուղեցույց

Ollama Strix Halo-ի վրա (Ryzen AI Max+ 395). տեղադրում, GPU-ի դետեկտ, առաջին մոդելը

Ollama-ի տեղադրումը Strix Halo տուփի վրա լռելյայն ուղով և բոլորին շփոթեցնող լոգ-տողի վերծանումը. ինչու է Vulkan ուղին դեն նետում ձեր iGPU-ն, ինչու է ROCm-ը, միևնույն է, վերցնում այն, և ինչպես ստուգել, որ մոդելն իրոք նստել է GPU-ի վրա, ոչ թե լուռ աշխատում է CPU-ի վրա։

Պլատֆորմ:
Strix Halo (Ryzen AI Max+ 395)
Անցնելու ժամանակը:
20 րոպե
Թարմացվել է:
01.09.2026

Ollama-ն ամենաարագ ճանապարհն է այս սարքաշարի վրա պատասխանող մոդել ստանալու, և տեղադրումն այստեղ իսկապես լռելյայն ուղին է. մեկ սկրիպտ, մեկ pull, մեկ run։ Ընդհանուր տուտորիալները բաց են թողնում հենց այն մասը, որ հատուկ է այս մեքենային. ինչ է իրականում տպում GPU-ի դետեկտը Ryzen AI Max+ 395-ի վրա, այդ տողերից որն է թակարդ, և ինչպես համոզվել, որ մոդելը նստել է GPU-ի վրա։ Այս տեքստը գրել ենք՝ տեղադրումը կատարելով մեր սեփական տուփերից մեկի վրա; ներքևի լոգ-տողերն իրական են։

Եթե կառավարվող լռելյայնի փոխարեն ուզում եք լիարժեք վերահսկողություն դրոշների, կոնտեքստի և ամրագրված տարբերակների վրա — դա llama.cpp ուղեցույցն է. Ollama-ն տակից աշխատեցնում է llama.cpp, իսկ որ շերտում աշխատել՝ առանձին հարց է։

Քայլ 0 — հիշողության առաստաղը, ինչպես միշտ

Ամեն ինչից առաջ. գլխավոր համակարգային պահանջն այստեղ ոչ թե դիստրիբուտիվի տարբերակն է, այլ հիշողության առաստաղը։ Linux-ի վրա, թե որքան հիշողություն է հասանելի GPU-ին, որոշում է միջուկի TTM պարամետրը, ոչ թե BIOS-ը։ Եթե դա բաց եք թողել, մեծ մոդելները կհրաժարվեն տեղավորվել՝ ինչ runtime էլ օգտագործեք — հիշողության հատկացման էջը դա բացատրում է։ Ճիշտ արվածի դեպքում Ollama-ն գործարկման պահին կհայտնի ամբողջ առաստաղը; մեր լոգում մեքենայի ամբողջ RAM-ից մի փոքր պակաս է։

Քայլ 1 — տեղադրում

Պաշտոնական ուղին այս սարքաշարի վրա աշխատում է.

curl -fsSL https://ollama.com/install.sh | sh

Պատրաստվեք բազմագիգաբայթանոց ներբեռնման — փաթեթը կրում է CPU, CUDA, ROCm և Vulkan backend-ները։ Սկրիպտը գրանցում է systemd ծառայություն և անմիջապես գործարկում այն։ Ստուգեք.

ollama --version
systemctl is-active ollama

Քայլ 2 — GPU-ի դետեկտը կարդացեք տեղացու պես, ոչ թե բագ-ռեպորտ գրողի

Հենց այստեղ է այս մեքենան տարբերվում տուտորիալներից։ Նայեք, թե ինչ է տեսել ծառայությունը.

journalctl -u ollama -n 80 | grep -iE "gpu|rocm|gfx|compute"

Մեր տուփի վրա թարմ տեղադրումը տպում է երկու տող, որոնք հակասական են թվում.

msg="dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1"
     id=0 library=Vulkan name=Vulkan0 description="AMD Radeon Graphics (RADV GFX1151)"
msg="inference compute" id=0 library=ROCm compute=gfx1151
     description="Radeon 8060S Graphics" type=iGPU total="117.4 GiB" available="117.4 GiB"

Վերծանում. Ollama-ի Vulkan ուղին ինտեգրված GPU-ները լռելյայն դեն է նետում — հենց առաջին տողի պատճառով են մարդիկ գնում issue-թրեքեր՝ համոզված, որ Ollama-ն չի տեսնում իրենց AMD վիդեոքարտը։ Բայց ներկառուցված ROCm backend-ը gfx1151-ը ճանաչում է ուղղակիորեն և վերցնում է սարքը՝ հիշողության ամբողջ առաստաղը տեսանելի։ Արդի Ollama-ի վրա այս սարքաշարը ROCm-ի միջոցով աշխատում է անմիջապես; OLLAMA_IGPU_ENABLE=1 պետք է միայն, եթե ուզում եք հենց Vulkan ուղին։ Եթե ձեր լոգում կա drop տողը և ROCm տող չկա, ձեր Ollama-ն ավելի հին է, քան ներկառուցված gfx1151 աջակցությունը — թարմացրեք այն, նախքան որևէ այլ բանի դիպչելը։

Քայլ 3 — pull և գործարկում

ollama pull llama3.2:3b
ollama run llama3.2:3b "Reply with one short sentence: what is inference?"

Սկսեք փոքր մոդելից՝ pipeline-ը վավերացնելու համար; չափսը մեծացրեք հետո։ Թե ինչ է իրականում տեղավորվում այս մեքենայի հիշողության դասում՝ չափված հարց է։

Քայլ 4 — ապացուցեք, որ մոդելը նստել է GPU-ի վրա

Ստուգումը, որը գրեթե ոչ ոք չի գործարկում, — և ամենակարևորը iGPU մեքենայի վրա, որտեղ լուռ CPU-fallback-ը տալիս է հավանական թվացող, բայց դանդաղ վարք.

ollama ps

PROCESSOR սյունը պարտավոր է ցույց տալ 100% GPU։ Մերը ցույց է տալիս։ XX%/XX% CPU/GPU-ի նման որևէ բան նշանակում է, որ մոդելի մի մասը դուրս է թափվել — չտեղավորվեց քայլ 0-ում կարգավորած առաստաղում, կամ GPU-ն ընդհանրապես չի վերցվել։ CPU-ի վրա «աշխատող» մոդելը դասական կանաչ-բայց-կոտրված վիճակն է. պատասխանները գալիս են, ամեն ինչ նորմալ է թվում, իսկ դուք լուռ ստանում եք ընդամենը մի մասնաբաժինն այն ամենի, ինչի ընդունակ է տուփը։

Արժե նաև իմանալ. Ollama-ն իր լռելյայն կոնտեքստը չափում է հայտնաբերված հիշողությունից (մերն ինքնուրույն ընտրեց վեցանիշ թոքենային պատուհան), իսկ պարապ մոդելները բեռնաթափում է մի քանի րոպե անց — ollama psUNTIL սյունը հենց այդ հետհաշվարկն է, ոչ թե սխալ։

Որտեղ է այս ուղին ավարտվում

Ollama-ի լռելյայն արժեքներն ընտրված են հարմարության համար և թողարկումների միջև շարժվում են։ Այն օրը, երբ ուզենաք որևէ բան չափել — կամ ձեր թվերը չհամընկնեն ուրիշների հետ, — անցեք սերվերին հարցնելուն, թե ինչ է իրականում աշխատեցնում, և ամրագրելուն, թե ինչ եք տեղակայում. այդ կարգապահության մեջ է ամբողջ տարբերությունը սետապի և կոնֆիգուրացիայի միջև։ Թիմ սպասարկելու համար հիշեք զուգահեռության սանդուղքը; Ollama-ն լռելյայն գալիս է մեկ զուգահեռ slot-ով։

← Բոլոր ուղեցույցները