Симптомы
Карточки симптомов: буквальная строка, причина, исправление
Карточки пишутся только по сбоям, которые лаборатория поймала сама и описала; каждая ссылается на отчёт или мануал, где это наблюдалось. На этой странице нет ни одной цифры производительности.
Strix Halo (Ryzen AI Max+ 395)
-
dropping integrated GPU; to enable, set OLLAMA_IGPU_ENABLE=1Ollama
Vulkan-путь Ollama по умолчанию отбрасывает интегрированные GPU, а встроенный ROCm-бэкенд сам подхватывает gfx1151, так что строка про drop действий не требует; обновляйте Ollama, только если следом нет строки ROCm, и убедитесь через ollama ps, что модель целиком легла на GPU.
-
mem_info_vram_total: 512 MiBllama.cpp server (Vulkan)
На Linux GPU дотягивается до unified memory через GTT, и потолок задаёт параметр ядра pages_limit для TTM, а не отрезанный в BIOS кусок VRAM; поднимите ttm.pages_limit в командной строке ядра, перезагрузитесь и перечитайте sysfs-файлы.
DGX Spark (GB10)
-
cuTensorMapEncodeTiled illegal memory accessvLLM
Драйвер 595.58.03 ломал NVFP4 на GB10 ошибкой illegal memory access в cuTensorMapEncodeTiled; запиньте драйвер 580.142. В той же mainline-сборке vLLM ядра под compute_120f распаковывали веса NVFP4 программно, а VLLM_USE_FLASHINFER_MOE_FP4=0 был обходом, а не лечением.
-
dcgm-exporter is dead and NVML answers N/Adcgm-exporter / NVML
На GB10 с unified memory dcgm-exporter не работает, а NVML отдаёт N/A по многим полям, на которые операторы вешают алерты; мы парсим nvidia-smi в textfile-коллектор node-exporter по systemd-таймеру и отдельным алертом ловим молчание самого коллектора.
-
the server must report the B12X backend, not the DEEPGEMM fallbackvLLM
Автовыбор MoE-бэкенда в vLLM пропускает FlashInfer-ядро MXFP4, лежащее в образе для DeepSeek-V4-Flash на GB10, и уходит в DEEPGEMM-фолбэк; передайте --moe-backend flashinfer_b12x и убедитесь по логу сервера, что выбран бэкенд B12X.
Любой локальный стек
-
HTTP 200, empty answerllama.cpp server (Vulkan)
Проход размышлений съел весь бюджет генерации до первого токена ответа, и сервер отрапортовал успех, не отдав ничего; поднимите бюджет или выключите reasoning и считайте токены ответа, а не коды статуса.
-
thinking stream starts immediately — it is just not addressed to the userllama.cpp server (Vulkan)
Первый токен в стриме — reasoning-блок модели, а не ответ: time-to-first-token выглядит мгновенным, а ответ начинается поздно или никогда. Засекайте время до первого токена ответа на клиенте, считайте пустые ответы отказами, выключайте reasoning там, где ворклоад позволяет.
-
your container will show unhealthy while serving perfectlyllama.cpp server (Docker)
Образ llama.cpp server везёт healthcheck, нацеленный на порт 8080; поднимите сервер на другом порту — и Docker пометит контейнер unhealthy, хотя тот исправно обслуживает запросы. Держите 8080 внутри контейнера или переопределите проверку.