Ախտանիշներ
Ախտանիշների քարտեր. բառացի տողը, պատճառը, ուղղումը
Քարտերը գրվում են միայն այն խափանումների համար, որոնց լաբորատորիան ինքն է բախվել և գրի առել; յուրաքանչյուրը հղում է այն հաշվետվությանը կամ ուղեցույցին, որտեղ դա դիտարկվել է։ Այս էջում արտադրողականության ոչ մի թիվ չկա։
Strix Halo (Ryzen AI Max+ 395)
-
dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1Ollama
Ollama-ի Vulkan ուղին ինտեգրված GPU-ները լռելյայն դեն է նետում, իսկ ներկառուցված ROCm backend-ը gfx1151-ն ինքն է վերցնում, ուստի drop տողը գործողություն չի պահանջում. Ollama-ն թարմացրեք միայն, եթե ROCm տող չի հաջորդում, և ollama ps-ով համոզվեք, որ մոդելն ամբողջովին GPU-ի վրա է։
-
mem_info_vram_total: 512 MiBllama.cpp server (Vulkan)
Linux-ի վրա GPU-ն unified memory-ին հասնում է GTT-ի միջոցով, իսկ առաստաղը միջուկի TTM pages_limit պարամետրն է, ոչ թե BIOS-ի VRAM կտորը. բարձրացրեք ttm.pages_limit-ը միջուկի հրամանային տողում, վերագործարկեք և վերընթերցեք sysfs ֆայլերը։
DGX Spark (GB10)
-
cuTensorMapEncodeTiled illegal memory accessvLLM
595.58.03 դրայվերը GB10-ի վրա կոտրեց NVFP4-ը cuTensorMapEncodeTiled-ի հիշողության անթույլատրելի դիմումով. ամրագրեք 580.142-ն։ Նույն mainline հավաքումում compute_120f-ի kernel-ները NVFP4 կշիռները ծրագրայնորեն էին բացում. VLLM_USE_FLASHINFER_MOE_FP4=0-ն շրջանցում է, ոչ թե ուղղում։
-
dcgm-exporter is dead and NVML answers N/Adcgm-exporter / NVML
GB10-ի unified memory-ի վրա dcgm-exporter-ը չի գործում, իսկ NVML-ը N/A է վերադարձնում շատ դաշտերի համար, որոնց վրա օպերատորներն ալերտ են դնում. մենք nvidia-smi-ի ելքը systemd timer-ով պարսում ենք node-exporter-ի textfile collector-ի համար՝ հնացման ալերտով հենց կոլեկտորի վրա։
-
the server must report the B12X backend, not the DEEPGEMM fallbackvLLM
vLLM-ի auto MoE բեքենդը բաց է թողնում GB10-ի վրա DeepSeek-V4-Flash-ի համար պատկերում ներառված FlashInfer MXFP4 միջուկը և անցնում է DEEPGEMM ֆոլբեքին. փոխանցեք --moe-backend flashinfer_b12x և սերվերի լոգում հաստատեք B12X բեքենդը։
Ցանկացած լոկալ ստեկ
-
HTTP 200, empty answerllama.cpp server (Vulkan)
Reasoning-անցումն ամբողջ ավարտման բյուջեն ծախսել է մինչև պատասխանի առաջին թոքենը, և սերվերը հաջողություն է հաղորդել՝ ցույց տալու ոչինչ չունենալով; մեծացրեք բյուջեն կամ անջատեք reasoning-ը և հաշվեք պատասխանի թոքենները, ոչ թե ստատուս-կոդերը։
-
thinking stream starts immediately — it is just not addressed to the userllama.cpp server (Vulkan)
Հոսքի առաջին թոքենը reasoning-բլոկն է, ոչ թե պատասխանը. time-to-first-token-ն ակնթարթային է թվում, պատասխանն ուշանում է կամ չի էլ գալիս։ Կլիենտում չափեք ժամանակը մինչև պատասխանի առաջին թոքենը, դատարկ պատասխանը հաշվեք ձախողում, reasoning-ն անջատեք, որտեղ workload-ը թույլ է տալիս։
-
your container will show unhealthy while serving perfectlyllama.cpp server (Docker)
llama.cpp server-ի image-ը բերում է 8080 պորտին ուղղված healthcheck; գործարկեք սերվերն այլ պորտի վրա, և Docker-ը կոնտեյները կնշի որպես unhealthy, մինչդեռ այն անթերի սպասարկում է։ Ներքին պորտը պահեք 8080-ի վրա կամ վերասահմանեք ստուգումը։