Исследования
Отчёты
Публичные исследования: замороженные конфигурации, результаты с ограничениями рядом, отрицательные находки включены, raw-доказательства приложены. Пререгистрация действует начиная с флагманской квалификации — опубликованные пока работы доказывают конвейер и говорят об этом прямо.
В работе
Strix Halo Runtime Qualification v1 — llama.cpp Vulkan vs ROCm на двух идентичных Beelink GTR9 Pro, квалификация AMD gfx1151 vLLM-контейнера, лестница long-context и 30-минутный endurance. Её пререгистрация будет закоммичена и опубликована до первого headline-прогона этого исследования.
- lab_repeated internal researchBeelink GTR9 Pro под локальные нейросети: что показали два юнита за месяц обслуживания
Обзоры гоняют эту коробку неделю. Мы купили две, заморозили ворклоады и с тех пор на них обслуживаем модели: рабочий софтовый стек, измеренные цифры, где два юнита сошлись — и то, за что мы всё ещё не ручаемся.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchvLLM на DGX Spark с контекстом 256K: рабочие конфиги, замеры и почему NVFP4 в mainline был сломан
Конспект нашего лонгрида: какие бэкенды vLLM пережили SM_121 на 256K контексте, почему NVFP4 в закреплённой mainline-сборке декодировал медленнее FP8, какая связка патчей удержала 260K — и замеры, привязанные к версиям весны 2026 года.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchЖелезо для локальной нейросети: какой ПК собрать под какую задачу, по измерениям
Гайды по железу для локальных нейросетей — это спеклисты, продавцы в роли обозревателей и партнёрские подборки. Здесь иначе: сначала ворклоад, потом коробка, каждая цифра измерена на нашем железе, а неизмеренные дорожки названы пробелами.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchКак сжать русский эмбеддер до 24 млн параметров и не соврать себе
Короткий ответ по мотивам нашего лонгрида: какой рецепт сжатия сработал для strizh-ru-retriever, какой красиво провалился, сколько качества стоили четыре слоя — и почему одна забытая строка конфига чуть не обнулила всю работу.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchКак резать документы для RAG, чтобы модель не переписывала текст
Конспект нашего лонгрида про agmind-rag-splitter-ru: почему чанкер, который переписывает текст, портит RAG-индекс, как LoRA-дообучение отвечает индексами границ в JSON, зачем опубликован обучающий корпус — и что метрики согласия с учителем говорят честно.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchПамять на Strix Halo: почему ROCm видит крохи от 128 ГБ и что крутить вместо BIOS
Самый частый первый отказ на коробке с Ryzen AI Max+ 395: модель не влезает или рантайм показывает пару гигабайт VRAM на машине со 128 ГБ. BIOS почти всегда не тот рычаг. Что отдаёт sysfs нашей обслуживающей ноды и какой параметр решает.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchДомашний AI-кластер из двух нод: зачем одна грязная, а одна чистая
Две одинаковые коробки на Strix Halo живут противоположными жизнями: одна тащит весь сервисный стек в контейнерах, вторая обслуживает одну модель и больше ничего. Это не аккуратность: наш харнесс бракует любой замер, если на хосте нашёлся GPU-сосед.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchllama.cpp, vLLM или Ollama: чем запускать локальную LLM на своём сервере
Гуляющие по сети советы списаны с бенчмарков датацентровых GPU и редко переживают встречу с одной коробкой. Для чего каждый движок на самом деле, какой и где гоняем мы сами и почему, и вопрос о дефолтах, который весит больше самого выбора.
21 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchВыдумывают ли локальные LLM ответы, которых нет в документе? Мы измерили
Галлюцинирует ли локальная модель на ваших документах — спрашивают все, измеряют единицы. В наш ворклоад встроен контроль: вопросы, на которые документ ответить не может, оцениваются по тому, признаёт ли это модель. Два семейства моделей — два способа не знать.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchСколько токенов в секунду достаточно локальной LLM?
Самый частый и наименее измеренный вопрос локального AI обычно закрывают выдуманными круглыми числами. Как скорость ощущается на реальной коробке: ожидание до первого полезного слова, поток после него и отказ, при котором токены в секунду теряют смысл.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchКак бенчмаркать локальную LLM, чтобы цифры пережили проверку
Большинству опубликованных скоростей локальных LLM нельзя даже возразить: при них нет конфигурации. Протокол лаборатории, публикующей сырые прогоны: что запинить, что спросить у работающего сервера, какие токены считать и почему отказы остаются в знаменателе.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchМожет ли локальная LLM надёжно отдавать строгий JSON? Измерено по квантам, бэкендам и моделям
Строгий JSON — несущая стена локальной автоматизации, но его надёжность обычно утверждают, а не измеряют. На одной коробке: квантизация её не сдвинула, бэкенд не сдвинул, режим размышлений не сдвинул — сдвинула смена семейства моделей.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchОтключать ли thinking? Сколько стоит режим размышлений на локальной LLM — измерено
Режим размышлений на локальной модели превращает первое видимое слово из мгновения в ожидание и умножает цену автоматизации — а на всех задачах с жёстким правильным ответом наши гейты не увидели выигрыша. Измеренный размен и где он не действует.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchStrix Halo или DGX Spark для локального AI? Что мы измерили на обеих коробках
Самое искомое сравнение в классе мини-коробок локального AI везде закрывают спеками и нигде — измерениями одной лаборатории на обеих платформах. У нас есть обе. Что каждая доказуемо сделала, какой ворклоад чьей коробке принадлежит и какое сравнение мы отказываемся подделывать.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchЧто реально запускают 128 ГБ unified-памяти: локальные LLM, измерено
Класс 128 ГБ unified-памяти — нынешняя золотая середина локальных LLM-коробок, и почти всё написанное о нём — спековая арифметика. Вот что одна такая коробка измеримо делает: какой класс моделей обслуживает, как быстро, для скольких людей и где 128 ГБ заканчиваются.
20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchDeepSeek-V4-Flash 0731 на двух DGX Spark: рецепт с размеченными ловушками
Точный серверный рецепт за нашими опубликованными цифрами на GB10: пиненные веса и образ, порядок запуска head-first против зависания TCPStore, MoE-флаг, который пропускает автовыбор, что мониторить, когда NVML молчит — и какие цифры ждать.
16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchGPU-мониторинг на DGX Spark: когда dcgm-exporter мёртв, а NVML отвечает N/A
Штатный стек GPU-наблюдаемости на unified memory GB10 работает наполовину: dcgm-exporter не запускается, NVML отдаёт N/A на заметной доле запросов, и Grafana остаётся зелёной и пустой. Коллектор, с которым мы реально обслуживаем vLLM, и как его собрать.
16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchСтоит ли DGX Spark своих денег под локальные LLM? Измеренный ответ
Самый частый покупательский вопрос ниши закрыт почти исключительно спековой арифметикой. Вот что пара GB10 реально сделала в нашей лаборатории — 284B MoE, кривая контекста до миллиона токенов — и кому её брать, а кому нет.
16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchПочему чат с документом тормозит один раз, а дальше отвечает мгновенно: кеш промпта llama.cpp, измеренный
Сессия вопросов к документу на коробке с Ryzen AI Max+ 395: сколько стоит первый вопрос к файлу на 32k токенов, сколько — второй с кешем промпта и без него, и единственное условие, без которого кеш не экономит ничего.
16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchQ8_0 или Q4_K_M? Что на самом деле покупает больший квант — измерено на одной коробке
Та же модель, та же сборка llama.cpp, та же коробка на Strix Halo, менялась только квантизация: чего Q8_0 стоит в темпе декода против Q4_K_M, что увидели наши гейты качества и какой дефицит на самом деле должен решать выбор.
16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchТри часа под нагрузкой: сдаёт ли мини-ПК на Strix Halo за рабочий день?
Непрерывный трёхчасовой обслуживающий проход на двух одинаковых юнитах с Ryzen AI Max+ 395 при конкурентности четыре: насколько уплыл темп декода между первыми пятью минутами и последними и какая доля запросов вернулась завершённой.
16 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchHTTP 200 и пустой ответ: режим отказа, которого не видит ваш мониторинг
Reasoning-модель может потратить весь токен-бюджет на размышления и вернуть успешный ответ с нулём видимого пользователю текста. Мы измерили, как часто это происходит на двух семействах моделей — и почему TTFT-дашборды при этом выглядят идеально.
14 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchКириллический налог: сколько русский текст реально стоит в токенах, измерено
Наш long-context корпус резался по оценке «символов на токен» — она держалась на английском и промахнулась на треть на русском. Измеренные счётчики опубликованы: что это значит для контекстных окон кириллицы и как мы поймали свою ошибку.
14 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchПочему опубликованные скорости DeepSeek на DGX Spark расходятся между собой
Одна и та же модель на тех же двух узлах GB10 публикуется со скоростями от конца пятидесятых до начала семидесятых токенов в секунду. Каждая из этих цифр может быть верной — вот конфигурация за каждой и какую цитировать под какой вопрос.
13 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchСколько людей реально могут делить одну локальную AI-коробку на 128 ГБ?
Измеренная лестница конкурентности на одном Strix Halo: как выглядит ожидание при одном, четырёх и восьми одновременных чатах, что осталось корректным и почему «токенов в секунду» не отвечает на вопрос о размере команды.
12 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchСпекулятивный DSpark на двух DGX Spark: кривая глубины до миллиона токенов
Наш fp8-запуск DSpark на GB10, независимая репродукция комьюнити-сборки NVFP4 и данные глубины, которых никто не публиковал: одиночная кривая до реального миллионного промпта — плюс два негативных результата, названные своими именами.
5 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_single_run internal researchvLLM auto выбрал не то MoE-ядро для DeepSeek-V4-Flash на GB10
DeepSeek-V4-Flash-0731 на двух узлах DGX Spark: образ содержит MoE-ядро под MXFP4-экспертов этой модели на этом кремнии — а автовыбор его пропускает. Ручной выбор стоит двузначных процентов декода. Рецепт и сырые результаты открыты.
3 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchВторая модель, второй квант, второй бэкенд: что переносится на одном ящике
Тот же юнит Strix Halo, три замены по одной за раз: второе семейство моделей воспроизводит режим пустых ответов; Q8_0 не покупает ничего измеримого на этих ворклоадах; ROCm работает на gfx1151, но декодит медленнее Vulkan.
3 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- lab_repeated internal researchПочему думающая модель долго молчит: time-to-first-token ничего не говорит о reasoning
На коробке Strix Halo привычная цифра TTFT выглядела отлично, а большинство запросов возвращали пустой ответ с HTTP 200. Клиентские замеры, три режима работы, evidence-пакеты приложены.
2 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- legacy internal researchDeepSeek-V4-Flash DSpark на 2× DGX Spark: контекст 1M — legacy-результаты
Bring-up спекулятивного декодирования DSpark на GB10 (sm_121) через 200G RoCE, кривая глубины до миллиона токенов, независимое воспроизведение комьюнити-сборки и два честных отрицательных результата.
31 июля 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
- legacy internal researchМультислотный LLM-инференс на Strix Halo — legacy-результаты
Что делает один мини-ПК Strix Halo со 128 ГБ под 32 параллельными чат-потоками: рецепты, обрыв конкурентности после 8 запросов во всех конфигурациях, и где спекулятивное декодирование перестаёт помогать.
31 июля 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование
Внешние публикации
Исследовательские статьи лаборатории на Хабре. Ссылки, не зеркала — оригиналы живут там.
- DeepSeek 0731 на DGX Spark: разгоняю до 68 tok/s и разбираюсь, почему у автора карточки 57
DeepSeek-V4-Flash на паре DGX Spark — лонгрид за нашим отчётом про MoE-бэкенд, включая разбор чужой цифры, которая не сходилась с нашей.
3 августа 2026 г. · habr.com
- Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой
Сжатие русского retrieval-эмбеддера и одна цифра, которая чуть всё не испортила.
28 июля 2026 г. · habr.com
- Мини-ПК на Strix Halo под параллельной нагрузкой: 236 tok/s на 32 одновременных запросах и три ошибки
Мультислотное обслуживание — то самое исследование из нашего legacy-отчёта, включая три собственные ошибки.
18 июля 2026 г. · habr.com
- Два AMD Strix Halo в AI-инфраструктуре: 34 контейнера на одном, ~70 tok/s Qwen3.6 на другом
Как реально устроен парк из двух Strix Halo: сервисный стек на одном, инференс на другом.
13 июля 2026 г. · habr.com
- DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново
Порт спекулятивного декодера DeepSeek на GB10 — баг в одну строку и перемеренные бенчмарки.
5 июля 2026 г. · habr.com
- Как я обучил русский RAG-сплиттер, который режет документы по индексам, а не по тексту
Обучение индексного русского сплиттера документов — того, что опубликован на Hugging Face.
4 июля 2026 г. · habr.com
- DeepSeek-V4-Flash на двух DGX Spark: как мы убрали очередь и получили multi-user
От очереди одного потока к настоящему multi-user на кластере из двух GB10.
22 июня 2026 г. · habr.com
- DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан
Перебор конфигураций vLLM на 256K контексте — и задокументированный сломанный NVFP4 в mainline.
9 мая 2026 г. · habr.com
- Кириллица в LLM: почему русский язык в нейросетях стоит дороже и работает медленнее
Почему кириллица дороже в токенах и медленнее — экономика токенизации русского языка.
7 мая 2026 г. · habr.com
- DGX Spark: мониторинг unified memory, когда NVML и dcgm-exporter молчат
Мониторинг unified memory на GB10, когда штатные инструменты NVIDIA молчат.
6 мая 2026 г. · habr.com
- Как я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло
Сборка приватного AI-сервера на DGX Spark — с чего начались инсталлеры AGmind.
3 мая 2026 г. · habr.com