Бесплатные мануалы
Мануалы по развёртыванию: локальные LLM на реальном железе, по шагам
Бесплатные мануалы только по тем стекам, которые мы реально разворачивали и с которых обслуживаем. Каждая помеченная ловушка — та, в которую мы попали сами; цифры производительности живут в измеренных отчётах, в одном клике.
Strix Halo (Ryzen AI Max+ 395)
- Развернуть локальную LLM на Strix Halo (Ryzen AI Max+ 395): llama.cpp с нуля до первого ответа
Точный путь, которым мы разворачиваем на собственных коробках: настройка памяти, о которой молчит BIOS, запиненный контейнер llama.cpp на Vulkan и три проверки, что сервер действительно работает, — включая два отказа, которые прячутся за зелёными статусами.
Время: 45 мин
- Ollama на Strix Halo (Ryzen AI Max+ 395): установка, детект GPU, первая модель
Установка Ollama на коробке со Strix Halo дефолтным путём и расшифровка строки лога, которая путает всех: почему Vulkan-путь отбрасывает ваш iGPU, почему ROCm всё равно его подхватывает и как проверить, что модель действительно легла на GPU, а не тихо работает на CPU.
Время: 20 мин
DGX Spark (GB10)
- Развернуть большой MoE на DGX Spark через vLLM: от одного узла до пары
Порядок развёртывания, обходящий тихие зависания, которые мы поймали на собственной паре GB10: запиненные веса и образ, head раньше peer, готовность по эндпоинту, а не по ощущению, и проверка выбора MoE-ядра, отделяющая быструю конфигурацию от той, которую гоняет большинство.
Время: 2-3 ч
Apple Silicon
Мануала пока нет — честно. M1 Max и M4 Pro — заявленные дорожки нашего стенда с нулём опубликованных прогонов. Мануал будет написан во время реального развёртывания на них, не раньше.
Consumer GPU
Мануала пока нет — честно. Прогонов CUDA-дорожки пока нет. Когда линия дискретных GPU запустится, её мануал будет написан с развёртывания, а не с чужих постов.