AGmind Systems Lab
Локальные LLM на реальном железе. Измерено.
Как быстро отвечает 35B-модель на коробке со 128 ГБ, что реально тянет пара DGX Spark, какой квант и бэкенд выбирать — измерено на собственном железе, с опубликованными сырыми прогонами и отказами в знаменателе.
Спецификация устройства говорит, сколько в нём памяти. Демо-бенчмарк даёт одно число. Ни то ни другое не отвечает, можно ли эксплуатировать вашу точную модель и runtime под вашей реальной нагрузкой. AGmind Systems Lab проверяет систему целиком и ограничивает каждый вывод тем, что реально прогонялось.
01Доказательства
Проверенные конфигурации
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — кэш сессии документа
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
- Workload:
- doc-session-v1 @ 2026-08-03 — пары вопросов с общим префиксом над документами 8k/32k токенов, EN+RU
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — три часа под непрерывной нагрузкой
- Система:
- 2× Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified — по одному проходу на юнит, бок о бок
- Workload:
- endurance-30m-v1 @ 2026-08-03 — human-корпус по кругу closed-loop 180 минут, чекпоинты 30/60/180 мин
- PARTIAL activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — бытовой ассистент
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified — однопользовательские ячейки реплицированы на втором коммерчески идентичном юните
- Workload:
- interactive-assistant-v2 @ 2026-08-02 — 16 бытовых задач, EN+RU
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — поиск по вставленному документу
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
- Workload:
- long-context-v1 @ 2026-08-03 — иголочная лестница, номинальные ступени 2k–32k (EN измерено 1.8k–30.0k, RU 1.4k–21.1k), с контролями
- PASS WITH LIMITS activeStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — строгий JSON для автоматизаций
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
- Workload:
- structured-agent-v1 @ 2026-08-03 — 16 детерминированных JSON-задач, EN+RU
Свежие отчёты
Все конфигурации →- Beelink GTR9 Pro под локальные нейросети: что показали два юнита за месяц обслуживания
Обзоры гоняют эту коробку неделю. Мы купили две, заморозили ворклоады и с тех пор на них обслуживаем модели: рабочий софтовый стек, измеренные цифры, где два юнита сошлись — и то, за что мы всё ещё не ручаемся.
- vLLM на DGX Spark с контекстом 256K: рабочие конфиги, замеры и почему NVFP4 в mainline был сломан
Конспект нашего лонгрида: какие бэкенды vLLM пережили SM_121 на 256K контексте, почему NVFP4 в закреплённой mainline-сборке декодировал медленнее FP8, какая связка патчей удержала 260K — и замеры, привязанные к версиям весны 2026 года.
- Железо для локальной нейросети: какой ПК собрать под какую задачу, по измерениям
Гайды по железу для локальных нейросетей — это спеклисты, продавцы в роли обозревателей и партнёрские подборки. Здесь иначе: сначала ворклоад, потом коробка, каждая цифра измерена на нашем железе, а неизмеренные дорожки названы пробелами.
- Как сжать русский эмбеддер до 24 млн параметров и не соврать себе
Короткий ответ по мотивам нашего лонгрида: какой рецепт сжатия сработал для strizh-ru-retriever, какой красиво провалился, сколько качества стоили четыре слоя — и почему одна забытая строка конфига чуть не обнулила всю работу.
- Как резать документы для RAG, чтобы модель не переписывала текст
Конспект нашего лонгрида про agmind-rag-splitter-ru: почему чанкер, который переписывает текст, портит RAG-индекс, как LoRA-дообучение отвечает индексами границ в JSON, зачем опубликован обучающий корпус — и что метрики согласия с учителем говорят честно.
- Память на Strix Halo: почему ROCm видит крохи от 128 ГБ и что крутить вместо BIOS
Самый частый первый отказ на коробке с Ryzen AI Max+ 395: модель не влезает или рантайм показывает пару гигабайт VRAM на машине со 128 ГБ. BIOS почти всегда не тот рычаг. Что отдаёт sysfs нашей обслуживающей ноды и какой параметр решает.
02Мануалы
Мануалы по развёртыванию
- Развернуть большой MoE на DGX Spark через vLLM: от одного узла до пары
Порядок развёртывания, обходящий тихие зависания, которые мы поймали на собственной паре GB10: запиненные веса и образ, head раньше peer, готовность по эндпоинту, а не по ощущению, и проверка выбора MoE-ядра, отделяющая быструю конфигурацию от той, которую гоняет большинство.
2-3 ч
- Развернуть локальную LLM на Strix Halo (Ryzen AI Max+ 395): llama.cpp с нуля до первого ответа
Точный путь, которым мы разворачиваем на собственных коробках: настройка памяти, о которой молчит BIOS, запиненный контейнер llama.cpp на Vulkan и три проверки, что сервер действительно работает, — включая два отказа, которые прячутся за зелёными статусами.
45 мин
- Ollama на Strix Halo (Ryzen AI Max+ 395): установка, детект GPU, первая модель
Установка Ollama на коробке со Strix Halo дефолтным путём и расшифровка строки лога, которая путает всех: почему Vulkan-путь отбрасывает ваш iGPU, почему ROCm всё равно его подхватывает и как проверить, что модель действительно легла на GPU, а не тихо работает на CPU.
20 мин
03Честность
Сбои и исправления
Отрицательные результаты — полноценный продукт лаборатории: оплаченный тест, опровергший заявление, публикуется (в независимом режиме) с той же строгостью, что и подтверждение. В errata фиксируется каждая правка опубликованных результатов.
Политика errata →04Метод
Методология
Каждая квалификация идёт по одному контролируемому процессу: согласованный вопрос, замороженные версии и workload, метрики и правила исключения, зафиксированные до прогонов (публичная пререгистрация — начиная с флагмана), сохранённые сбои и невалидные прогоны, ограниченный вывод и воспроизводимый evidence bundle. Каждая headline-цифра несёт уровень доказательности, говорящий, сколько измерений за ней стоит — результаты одного прогона помечены как таковые и никогда не выдаются за повторённые; отказавшие запросы остаются в знаменателе.
Читать методологию →05Стенды
Железо лаборатории
Стенды, которые реально существуют в лаборатории, с их ограничениями. Ни один результат не обобщается за пределы протестированного юнита и версий.
| Стенд | Спецификация | Роль | Ограничение | Статус |
|---|---|---|---|---|
| 2× Beelink GTR9 Pro — AMD Strix Halo | Ryzen AI Max+ 395, 128 ГБ LPDDR5X-8000 unified, Radeon 8060S (gfx1151), два 10GbE — два коммерчески идентичных юнита | Флагманская цель квалификации: сравнение бэкендов (Vulkan vs ROCm), репликация между юнитами, multi-slot serving, RAG-сервисы | Два юнита не представляют всю производственную партию | online |
| 2× NVIDIA DGX Spark — GB10 | GB10 Grace Blackwell, 20-ядерный Arm, 128 ГБ unified, sm_121, ConnectX-7 — соединены точка-точка по 200G RoCE | Портируемость aarch64/sm_121, multi-node топологии, long-context и speculative decoding | Дорогой узкий стенд; результаты не обобщаются на датацентровый Blackwell | online |
| RTX 5090 workstation | Потребительский Blackwell, 32 ГБ GDDR7, x86-хост | Контрольная CUDA-линия, fine-tuning/дистилляция, базовые замеры на потребительской GPU | Одна конфигурация; не enterprise-сервер | online |
| Apple M1 Max, 64 GB | Apple Silicon, 64 ГБ unified, macOS / MLX-линия | Smoke-тесты Apple/MLX и небольшие кросс-платформенные якоря | Не текущее старшее поколение Apple | online |
| MacBook Pro — Apple M4 Pro, 24 GB | Apple Silicon M4 Pro, 24 ГБ unified, macOS / MLX-линия | Якорь текущего поколения Apple: локальный инференс ноутбучного класса, сравнения MLX и llama.cpp Metal | 24 ГБ ограничивают размер модели; терморежим ноутбука, не десктопа | online |
| Laptop — Ryzen 9 9955HX + RTX 5070 Ti | Ryzen 9 9955HX (Zen 5, 16 ядер), RTX 5070 Ti Laptop 12 ГБ GDDR7, 32 ГБ DDR5 | Линия ноутбуков с дискретной GPU: мобильный Blackwell CUDA, инференс при дефиците VRAM и offload-сценарии против машин с unified-памятью | 12 ГБ VRAM вынуждают offload для средних моделей; терморежим ноутбука | online |
06Услуги
Что квалифицирует AGmind
-
Vendor Claim Evidence Pack
Верно ли одно конкретное публичное утверждение о системе при заявленных условиях?
Вердикт с доказательствами: raw-артефакты, ограничения, рецепт воспроизведения.
-
Workload Capacity Qualification
Какую нагрузку держит эта точная система под нашим workload и SLO?
Operating envelope: рекомендованный диапазон, диапазон с ограничениями, граница отказа SLO, известные сбои.
-
Runtime/Model Portability Sprint
Можно ли завести наш exact runtime/модель на Strix Halo, GB10, RTX или Apple Silicon — и что для этого нужно?
Диагноз с точными точками отказа, затем (опционально) патчи/флаги/рецепты сборки с маркировкой commissioned engineering.
-
Long-Context Reliability Qualification
Сколько контекста реально полезно на этой системе — а не сколько влезает в память?
Вердикт полезного контекста по глубинам с доказательствами качества, профилем задержек и документацией сбоев.
-
Procurement Decision Pack
Какую из 2–4 систем-кандидатов покупать под наш workload?
Сравнение с доказательствами и явными ограничениями — без универсального балла.
-
Air-Gapped Readiness Check
Установится и заработает ли этот стек в изолированном сегменте сети?
Проверенный чек-лист технических контролей с доказательствами по каждому.
Сознательно не предлагаем пока
Это станет продуктами только после того, как платный спрос докажет, что они нужны:
- AGmind Reference Stack после demand gate
- Release Revalidation Channel после demand gate
- BenchOps после demand gate
07Workloads
Библиотека workloads
Квалификация гоняется на фиксированных версионируемых workloads, а не на случайных промптах. Все v1-workloads — черновики, пока их корпуса, хэши и acceptance-проверки не заморожены.
- interactive-assistant-v1 released
Отзывчив ли одиночный стриминговый чат на этой системе?
- interactive-assistant-v2 released
Отзывчив ли одиночный стриминговый чат на этой системе в повседневных человеческих задачах?
- team-serving-v1 Черновик
Какой поток запросов система держит в рамках заявленного SLO?
- long-context-v1 released
Какова глубина полезного контекста на системе — а не настраиваемого?
- structured-agent-v1 released
Надёжен ли строгий JSON-вывод в повседневных задачах автоматизации на этой системе?
- endurance-30m-v1 released
Деградирует ли система под длительной нагрузкой — и когда именно?
- rag-pipeline-ru-v0 Внутренний
Где именно русскоязычный RAG-пайплайн теряет качество, покомпонентно?
- doc-session-v1 released
Платит ли второй вопрос по тому же вставленному документу полный префилл заново?
08Scope
Заказать квалификацию
Вы покупаете контролируемый процесс, а не положительный результат. Оплата не зависит от вердикта, финансирование раскрывается, независимые тесты отделены от commissioned engineering.