Отчёт

Strix Halo или DGX Spark для локального AI? Что мы измерили на обеих коробках

Самое искомое сравнение в классе мини-коробок локального AI везде закрывают спеками и нигде — измерениями одной лаборатории на обеих платформах. У нас есть обе. Что каждая доказуемо сделала, какой ворклоад чьей коробке принадлежит и какое сравнение мы отказываемся подделывать.

lab_repeated internal research 20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Сначала честный заголовок: это разные инструменты, которые рынок упорно меряет друг против друга при выборе. Одна коробка — измеренная, скучная рабочая лошадка для класса моделей, который большинство людей реально запускает. Пара других — единственный известный нам настольный способ обслуживать самый крупный открытый класс MoE, с настоящими острыми краями в эксплуатации. Мы владеем обеими платформами и измерили обе; в поисковой выдаче этого сравнения так не может сказать никто.

Почему это сравнение так трудно найти измеренным?

Потому что честно его сделать по-настоящему неудобно. Две платформы хотят разных рантаймов, благоволят разным классам моделей, и каждое найденное нами опубликованное «лоб в лоб» либо перегоняет вендорские цифры, либо цитирует рядом две несовместимые цифры из сообщества — так и рождается бенчмарковый фольклор. Дальше обе коробки держатся в отдельных, явно очерченных колонках, а последний раздел называет измерение, которое соединило бы их по-честному.

Что реально сделала коробка Strix Halo?

Один юнит Ryzen AI Max+ 395 со 128 ГБ unified-памяти, llama.cpp запинен по digest, обслуживает MoE класса 35B. Повседневные запросы: первый токен ответа за 210мсunit_replicated. Четыре одновременных чата: 338мсrepeated до первого слова, завершаемость держится на 100.0% запросовrepeated даже на восьми потоках. Документ в 32k токенов стоит 33965мсrepeated на входе, а три непрерывных часа обслуживания держали темп на 30.0мс/токенsingle_run. Полные таблицы — в репозитории бенчмарков и отчёте о 128 ГБ.

Что реально сделала пара DGX Spark?

Два юнита GB10 через линк 200G обслуживали DeepSeek-V4-Flash — MoE на 284B параметров — через vLLM, достаточно стабильно, чтобы опубликовать сырые прогоны и рецепт с размеченными ловушками. Пара прошла кривую контекста до миллиона токенов и сказала правду о счёте: декод на глубине выходит на плато, но первое заполнение окна в миллион токенов — событие, которое планируют, а не запрос, который просто отправляют. Пусконаладка была настоящей работой: флаг выбора ядер, который автоматический режим пропускает, отделяет быструю конфигурацию от той, которую измеряет большинство, а штатный мониторинг GPU в лучшем случае полуработает. Ответ покупателю, включая то, кому её покупать не стоит, — отдельная страница.

Какая коробка под какой ворклоад?

Из того, что мы измерили, а не из спецификаций. Личный ассистент, чат-коробка маленькой команды, вопросы к документам в диапазоне десятков тысяч токенов, JSON-автоматизация: коробка Strix Halo делает всё это уже сегодня, тихо, с цифрами выше. Обслуживание самого крупного открытого класса MoE под собственной крышей или длинноконтекстные исследования, где окно в миллион токенов амортизируется, — это то, что доказуемо сделала пара Spark, и ничто в нашем парке такого размера с ней не сравнилось. Если ваш вопрос — «какая из них для домашнего ассистента», вы выбираете между измеренным «да» и сверхквалифицированным «может быть». Если ваш вопрос — «можно ли обслуживать фронтирные открытые модели локально», в нашей лаборатории это сделала только одна из платформ — парой и со швами.

Почему наши цифры не совпадают с обзорами, которые вы читали?

Потому что большинство опубликованных цифр по обеим платформам — конфиги под прикрытием: неназванные профили ворклоадов, сдвинутые дефолты, прошивка до обновления. Мы написали сверку расходящихся цифр Spark вместо того, чтобы добавить ещё одну цифру-сироту, и протокол публикации чисел, с которыми можно аргументированно не согласиться. Оба применимы к любой цифре на этой странице.

Чего мы НЕ измеряли

Чистого сравнения — та же модель, тот же рантайм, тот же ворклоад, обе коробки, один харнесс — пока не существует ни у нас, ни где-либо ещё, где мы смогли бы его найти. Наша дорожка Strix гоняла Qwen3.6 и gemma-4 под llama.cpp; дорожка Spark — DeepSeek-V4-Flash под vLLM. Любая таблица, ставящая эти цифры в соседние колонки, производила бы ровно тот фольклор, разоблачать который мы и существуем, — поэтому на этой странице такой таблицы нет. Кросс-устройственная ячейка на одном харнессе запланирована; когда она приземлится, её клеймы будут нести скоуп сравнения на уровне систем, и эту страницу вытеснит нечто лучшее. До тех пор: две честные колонки лучше одной фальшивой таблицы.

У каждой цифры Strix выше есть постоянная страница с сырыми прогонами в реестре клеймов; каждое утверждение о Spark ссылается на свой опубликованный репозиторий прогонов.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-20). Strix Halo или DGX Spark для локального AI? Что мы измерили на обеих коробках. Evidence level: lab_repeated. https://agmind.ai/ru/reports/strix-halo-vs-dgx-spark/
← Отчёты