AGmind Systems Lab
Квалификация локального AI как целой системы.
Точные версии железа и софта, артефакты моделей, фиксированные нагрузки, измеренные рабочие пределы, известные сбои и воспроизводимые deployment-рецепты.
Спецификация устройства говорит, сколько в нём памяти. Демо-бенчмарк даёт одно число. Ни то ни другое не отвечает, можно ли эксплуатировать вашу точную модель и runtime под вашей реальной нагрузкой. AGmind Systems Lab проверяет систему целиком и ограничивает каждый вывод тем, что реально прогонялось.
01Доказательства
Проверенные конфигурации
Опубликованных конфигураций пока нет
Первые карточки выйдут вместе с флагманом Strix Halo Runtime Qualification v1. Карточки появляются здесь только после валидации прогонов по методологии v1 — legacy-данные задним числом не переносятся.
02Услуги
Что квалифицирует AGmind
-
Vendor Claim Evidence Pack
Верно ли одно конкретное публичное утверждение о системе при заявленных условиях?
Вердикт с доказательствами: raw-артефакты, ограничения, рецепт воспроизведения.
-
Workload Capacity Qualification
Какую нагрузку держит эта точная система под нашим workload и SLO?
Operating envelope: рекомендованный диапазон, диапазон с ограничениями, граница отказа SLO, известные сбои.
-
Runtime/Model Portability Sprint
Можно ли завести наш exact runtime/модель на Strix Halo, GB10, RTX или Apple Silicon — и что для этого нужно?
Диагноз с точными точками отказа, затем (опционально) патчи/флаги/рецепты сборки с маркировкой commissioned engineering.
-
Long-Context Reliability Qualification
Сколько контекста реально полезно на этой системе — а не сколько влезает в память?
Вердикт полезного контекста по глубинам с доказательствами качества, профилем задержек и документацией сбоев.
-
Procurement Decision Pack
Какую из 2–4 систем-кандидатов покупать под наш workload?
Сравнение с доказательствами и явными ограничениями — без универсального балла.
-
Air-Gapped Readiness Check
Установится и заработает ли этот стек в изолированном сегменте сети?
Проверенный чек-лист технических контролей с доказательствами по каждому.
Сознательно не предлагаем пока
Это станет продуктами только после того, как платный спрос докажет, что они нужны:
- AGmind Reference Stack после demand gate
- Release Revalidation Channel после demand gate
- BenchOps после demand gate
03Честность
Сбои и исправления
Отрицательные результаты — полноценный продукт лаборатории: оплаченный тест, опровергший заявление, публикуется (в независимом режиме) с той же строгостью, что и подтверждение. В errata фиксируется каждая правка опубликованных результатов.
Политика errata →04Метод
Методология
Каждая квалификация идёт по одному контролируемому процессу: согласованный вопрос, замороженные версии и workload, пререгистрированные метрики и правила исключения, сохранённые сбои и невалидные прогоны, ограниченный вывод и воспроизводимый evidence bundle. Для headline-цифр повторы обязательны; отказавшие запросы остаются в знаменателе.
Читать методологию →05Workloads
Библиотека workloads
Квалификация гоняется на фиксированных версионируемых workloads, а не на случайных промптах. Все v1-workloads — черновики, пока их корпуса, хэши и acceptance-проверки не заморожены.
- interactive-assistant-v1 Черновик
Отзывчив ли одиночный стриминговый чат на этой системе?
- team-serving-v1 Черновик
Какой поток запросов система держит в рамках заявленного SLO?
- long-context-v1 Черновик
Какова глубина полезного контекста на системе — а не настраиваемого?
- structured-agent-v1 Черновик
Надёжен ли JSON/function calling под реалистичным агентным трафиком?
- endurance-30m-v1 Черновик
Переживает ли предварительно квалифицированная рабочая точка 30 минут постоянной нагрузки?
- rag-pipeline-ru-v0 Внутренний
Где именно русскоязычный RAG-пайплайн теряет качество, покомпонентно?
06Стенды
Железо лаборатории
Стенды, которые реально существуют в лаборатории, с их ограничениями. Ни один результат не обобщается за пределы протестированного юнита и версий.
| Стенд | Спецификация | Роль | Ограничение | Статус |
|---|---|---|---|---|
| 2× Beelink GTR9 Pro — AMD Strix Halo | Ryzen AI Max+ 395, 128 ГБ LPDDR5X-8000 unified, Radeon 8060S (gfx1151), два 10GbE — два коммерчески идентичных юнита | Флагманская цель квалификации: сравнение бэкендов (Vulkan vs ROCm), репликация между юнитами, multi-slot serving, RAG-сервисы | Два юнита не представляют всю производственную партию | online |
| 2× NVIDIA DGX Spark — GB10 | GB10 Grace Blackwell, 20-ядерный Arm, 128 ГБ unified, sm_121, ConnectX-7 — соединены точка-точка по 200G RoCE | Портируемость aarch64/sm_121, multi-node топологии, long-context и speculative decoding | Дорогой узкий стенд; результаты не обобщаются на датацентровый Blackwell | online |
| RTX 5090 workstation | Потребительский Blackwell, 32 ГБ GDDR7, x86-хост | Контрольная CUDA-линия, fine-tuning/дистилляция, базовые замеры на потребительской GPU | Одна конфигурация; не enterprise-сервер | online |
| Apple M1 Max, 64 GB | Apple Silicon, 64 ГБ unified, macOS / MLX-линия | Smoke-тесты Apple/MLX и небольшие кросс-платформенные якоря | Не текущее старшее поколение Apple | online |
07Scope
Заказать квалификацию
Вы покупаете контролируемый процесс, а не положительный результат. Оплата не зависит от вердикта, финансирование раскрывается, независимые тесты отделены от commissioned engineering.