# Strix Halo или DGX Spark для локального AI? Что мы измерили на обеих коробках

> Самое искомое сравнение в классе мини-коробок локального AI везде закрывают спеками и нигде — измерениями одной лаборатории на обеих платформах. У нас есть обе. Что каждая доказуемо сделала, какой ворклоад чьей коробке принадлежит и какое сравнение мы отказываемся подделывать.

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/strix-halo-vs-dgx-spark/

Сначала честный заголовок: это разные инструменты, которые рынок упорно
меряет друг против друга при выборе. Одна коробка — измеренная, скучная
рабочая лошадка для класса моделей, который большинство людей реально
запускает. Пара других — единственный известный нам настольный способ
обслуживать самый крупный открытый класс MoE, с настоящими острыми краями
в эксплуатации. Мы владеем обеими платформами и измерили обе; в поисковой
выдаче этого сравнения так не может сказать никто.

## Почему это сравнение так трудно найти измеренным?

Потому что честно его сделать по-настоящему неудобно. Две платформы хотят
разных рантаймов, благоволят разным классам моделей, и каждое найденное
нами опубликованное «лоб в лоб» либо перегоняет вендорские цифры, либо
цитирует рядом две несовместимые цифры из сообщества —
[так и рождается бенчмарковый фольклор](https://agmind.ai/ru/essays/benchmark-number-config-in-disguise/).
Дальше обе коробки держатся в отдельных, явно очерченных колонках, а
последний раздел называет измерение, которое соединило бы их по-честному.

## Что реально сделала коробка Strix Halo?

Один юнит Ryzen AI Max+ 395 со 128 ГБ unified-памяти, llama.cpp запинен по
digest, обслуживает MoE класса 35B. Повседневные запросы: первый токен
ответа за
**210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/)). Четыре
одновременных чата:
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)) до первого
слова, завершаемость держится на
**100.0 % of requests** ([strix.qwen36.interactive2.c8.completion-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.completion-nothink/)) даже
на восьми потоках. Документ в 32k токенов стоит
**33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)) на входе, а три
непрерывных часа обслуживания держали темп на
**30.0 ms/token** ([strix.qwen36.endurance.c4.itl-median](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-median/)). Полные
таблицы — в
[репозитории бенчмарков](https://github.com/botAGI/strix-halo-llm-benchmarks)
и [отчёте о 128 ГБ](https://agmind.ai/ru/reports/what-128gb-unified-memory-runs/).

## Что реально сделала пара DGX Spark?

Два юнита GB10 через линк 200G обслуживали DeepSeek-V4-Flash — MoE на 284B
параметров — через vLLM, достаточно стабильно, чтобы опубликовать
[сырые прогоны](https://github.com/botAGI/dspark-0731-gb10) и
[рецепт с размеченными ловушками](https://agmind.ai/ru/reports/deepseek-v4-flash-0731-dgx-spark-recipe/).
Пара прошла кривую контекста до миллиона токенов и
[сказала правду о счёте](https://agmind.ai/ru/reports/dspark-speculative-1m-dgx-spark/):
декод на глубине выходит на плато, но первое заполнение окна в миллион
токенов — событие, которое планируют, а не запрос, который просто
отправляют. Пусконаладка была настоящей работой:
[флаг выбора ядер](https://agmind.ai/ru/reports/dsv4-flash-moe-backend-dgx-spark/), который
автоматический режим пропускает, отделяет быструю конфигурацию от той,
которую измеряет большинство, а штатный мониторинг GPU
[в лучшем случае полуработает](https://agmind.ai/ru/reports/dgx-spark-gpu-monitoring/).
Ответ покупателю, включая то, кому её покупать не стоит, —
[отдельная страница](https://agmind.ai/ru/reports/dgx-spark-worth-it/).

## Какая коробка под какой ворклоад?

Из того, что мы измерили, а не из спецификаций. Личный ассистент,
чат-коробка маленькой команды, вопросы к документам в диапазоне десятков
тысяч токенов, JSON-автоматизация: коробка Strix Halo делает всё это уже
сегодня, тихо, с цифрами выше. Обслуживание самого крупного открытого
класса MoE под собственной крышей или длинноконтекстные исследования, где
окно в миллион токенов амортизируется, — это то, что доказуемо сделала
пара Spark, и ничто в нашем парке такого размера с ней не сравнилось. Если
ваш вопрос — «какая из них для домашнего ассистента», вы выбираете между
измеренным «да» и сверхквалифицированным «может быть». Если ваш вопрос —
«можно ли обслуживать фронтирные открытые модели локально», в нашей
лаборатории это сделала только одна из платформ — парой и со швами.

## Почему наши цифры не совпадают с обзорами, которые вы читали?

Потому что большинство опубликованных цифр по обеим платформам — конфиги
под прикрытием: неназванные профили ворклоадов, сдвинутые дефолты, прошивка
до обновления. Мы написали
[сверку расходящихся цифр Spark](https://agmind.ai/ru/reports/dspark-speed-numbers-disagree/)
вместо того, чтобы добавить ещё одну цифру-сироту, и
[протокол](https://agmind.ai/ru/reports/how-to-benchmark-local-llm/) публикации чисел, с
которыми можно аргументированно не согласиться. Оба применимы к любой
цифре на этой странице.

## Чего мы НЕ измеряли

Чистого сравнения — та же модель, тот же рантайм, тот же ворклоад, обе
коробки, один харнесс — пока не существует ни у нас, ни где-либо ещё, где
мы смогли бы его найти. Наша дорожка Strix гоняла Qwen3.6 и gemma-4 под
llama.cpp; дорожка Spark — DeepSeek-V4-Flash под vLLM. Любая таблица,
ставящая эти цифры в соседние колонки, производила бы ровно тот фольклор,
разоблачать который мы и существуем, — поэтому на этой странице такой
таблицы нет. Кросс-устройственная ячейка на одном харнессе запланирована;
когда она приземлится, её клеймы будут нести скоуп сравнения на уровне
систем, и эту страницу вытеснит нечто лучшее. До тех пор: две честные
колонки лучше одной фальшивой таблицы.

У каждой цифры Strix выше есть постоянная страница с сырыми прогонами в
[реестре клеймов](https://agmind.ai/ru/claims/); каждое утверждение о Spark ссылается на
свой опубликованный репозиторий прогонов.

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
