Տեղակայման ուղեցույց
Ollama Strix Halo-ի վրա (Ryzen AI Max+ 395). տեղադրում, GPU-ի դետեկտ, առաջին մոդելը
Ollama-ի տեղադրումը Strix Halo տուփի վրա լռելյայն ուղով և բոլորին շփոթեցնող լոգ-տողի վերծանումը. ինչու է Vulkan ուղին դեն նետում ձեր iGPU-ն, ինչու է ROCm-ը, միևնույն է, վերցնում այն, և ինչպես ստուգել, որ մոդելն իրոք նստել է GPU-ի վրա, ոչ թե լուռ աշխատում է CPU-ի վրա։
- Պլատֆորմ:
- Strix Halo (Ryzen AI Max+ 395)
- Անցնելու ժամանակը:
- 20 րոպե
- Թարմացվել է:
- 01.09.2026
Ollama-ն ամենաարագ ճանապարհն է այս սարքաշարի վրա պատասխանող մոդել ստանալու, և տեղադրումն այստեղ իսկապես լռելյայն ուղին է. մեկ սկրիպտ, մեկ pull, մեկ run։ Ընդհանուր տուտորիալները բաց են թողնում հենց այն մասը, որ հատուկ է այս մեքենային. ինչ է իրականում տպում GPU-ի դետեկտը Ryzen AI Max+ 395-ի վրա, այդ տողերից որն է թակարդ, և ինչպես համոզվել, որ մոդելը նստել է GPU-ի վրա։ Այս տեքստը գրել ենք՝ տեղադրումը կատարելով մեր սեփական տուփերից մեկի վրա; ներքևի լոգ-տողերն իրական են։
Եթե կառավարվող լռելյայնի փոխարեն ուզում եք լիարժեք վերահսկողություն դրոշների, կոնտեքստի և ամրագրված տարբերակների վրա — դա llama.cpp ուղեցույցն է. Ollama-ն տակից աշխատեցնում է llama.cpp, իսկ որ շերտում աշխատել՝ առանձին հարց է։
Քայլ 0 — հիշողության առաստաղը, ինչպես միշտ
Ամեն ինչից առաջ. գլխավոր համակարգային պահանջն այստեղ ոչ թե դիստրիբուտիվի տարբերակն է, այլ հիշողության առաստաղը։ Linux-ի վրա, թե որքան հիշողություն է հասանելի GPU-ին, որոշում է միջուկի TTM պարամետրը, ոչ թե BIOS-ը։ Եթե դա բաց եք թողել, մեծ մոդելները կհրաժարվեն տեղավորվել՝ ինչ runtime էլ օգտագործեք — հիշողության հատկացման էջը դա բացատրում է։ Ճիշտ արվածի դեպքում Ollama-ն գործարկման պահին կհայտնի ամբողջ առաստաղը; մեր լոգում մեքենայի ամբողջ RAM-ից մի փոքր պակաս է։
Քայլ 1 — տեղադրում
Պաշտոնական ուղին այս սարքաշարի վրա աշխատում է.
curl -fsSL https://ollama.com/install.sh | sh
Պատրաստվեք բազմագիգաբայթանոց ներբեռնման — փաթեթը կրում է CPU, CUDA, ROCm և Vulkan backend-ները։ Սկրիպտը գրանցում է systemd ծառայություն և անմիջապես գործարկում այն։ Ստուգեք.
ollama --version
systemctl is-active ollama
Քայլ 2 — GPU-ի դետեկտը կարդացեք տեղացու պես, ոչ թե բագ-ռեպորտ գրողի
Հենց այստեղ է այս մեքենան տարբերվում տուտորիալներից։ Նայեք, թե ինչ է տեսել ծառայությունը.
journalctl -u ollama -n 80 | grep -iE "gpu|rocm|gfx|compute"
Մեր տուփի վրա թարմ տեղադրումը տպում է երկու տող, որոնք հակասական են թվում.
msg="dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1"
id=0 library=Vulkan name=Vulkan0 description="AMD Radeon Graphics (RADV GFX1151)"
msg="inference compute" id=0 library=ROCm compute=gfx1151
description="Radeon 8060S Graphics" type=iGPU total="117.4 GiB" available="117.4 GiB"
Վերծանում. Ollama-ի Vulkan ուղին ինտեգրված GPU-ները լռելյայն դեն է
նետում — հենց առաջին տողի պատճառով են մարդիկ գնում issue-թրեքեր՝
համոզված, որ Ollama-ն չի տեսնում իրենց AMD վիդեոքարտը։ Բայց
ներկառուցված ROCm backend-ը gfx1151-ը ճանաչում է ուղղակիորեն և
վերցնում է սարքը՝ հիշողության ամբողջ առաստաղը տեսանելի։ Արդի Ollama-ի
վրա այս սարքաշարը ROCm-ի միջոցով աշխատում է անմիջապես;
OLLAMA_IGPU_ENABLE=1 պետք է միայն, եթե ուզում եք հենց Vulkan ուղին։
Եթե ձեր լոգում կա drop տողը և ROCm տող չկա, ձեր Ollama-ն ավելի հին է,
քան ներկառուցված gfx1151 աջակցությունը — թարմացրեք այն, նախքան որևէ այլ
բանի դիպչելը։
Քայլ 3 — pull և գործարկում
ollama pull llama3.2:3b
ollama run llama3.2:3b "Reply with one short sentence: what is inference?"
Սկսեք փոքր մոդելից՝ pipeline-ը վավերացնելու համար; չափսը մեծացրեք հետո։ Թե ինչ է իրականում տեղավորվում այս մեքենայի հիշողության դասում՝ չափված հարց է։
Քայլ 4 — ապացուցեք, որ մոդելը նստել է GPU-ի վրա
Ստուգումը, որը գրեթե ոչ ոք չի գործարկում, — և ամենակարևորը iGPU մեքենայի վրա, որտեղ լուռ CPU-fallback-ը տալիս է հավանական թվացող, բայց դանդաղ վարք.
ollama ps
PROCESSOR սյունը պարտավոր է ցույց տալ 100% GPU։ Մերը ցույց է
տալիս։ XX%/XX% CPU/GPU-ի նման որևէ բան նշանակում է, որ մոդելի մի
մասը դուրս է թափվել — չտեղավորվեց քայլ 0-ում կարգավորած առաստաղում,
կամ GPU-ն ընդհանրապես չի վերցվել։ CPU-ի վրա «աշխատող» մոդելը դասական
կանաչ-բայց-կոտրված վիճակն է.
պատասխանները գալիս են, ամեն ինչ նորմալ է թվում, իսկ դուք լուռ ստանում
եք ընդամենը մի մասնաբաժինն այն ամենի, ինչի ընդունակ է տուփը։
Արժե նաև իմանալ. Ollama-ն իր լռելյայն կոնտեքստը չափում է հայտնաբերված
հիշողությունից (մերն ինքնուրույն ընտրեց վեցանիշ թոքենային պատուհան),
իսկ պարապ մոդելները բեռնաթափում է մի քանի րոպե անց — ollama ps-ի
UNTIL սյունը հենց այդ հետհաշվարկն է, ոչ թե սխալ։
Որտեղ է այս ուղին ավարտվում
Ollama-ի լռելյայն արժեքներն ընտրված են հարմարության համար և թողարկումների միջև շարժվում են։ Այն օրը, երբ ուզենաք որևէ բան չափել — կամ ձեր թվերը չհամընկնեն ուրիշների հետ, — անցեք սերվերին հարցնելուն, թե ինչ է իրականում աշխատեցնում, և ամրագրելուն, թե ինչ եք տեղակայում. այդ կարգապահության մեջ է ամբողջ տարբերությունը սետապի և կոնֆիգուրացիայի միջև։ Թիմ սպասարկելու համար հիշեք զուգահեռության սանդուղքը; Ollama-ն լռելյայն գալիս է մեկ զուգահեռ slot-ով։