# Что реально запускают 128 ГБ unified-памяти: локальные LLM, измерено

> Класс 128 ГБ unified-памяти — нынешняя золотая середина локальных LLM-коробок, и почти всё написанное о нём — спековая арифметика. Вот что одна такая коробка измеримо делает: какой класс моделей обслуживает, как быстро, для скольких людей и где 128 ГБ заканчиваются.

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Собственное финансирование, внутреннее исследование
- Canonical: https://agmind.ai/ru/reports/what-128gb-unified-memory-runs/

Короткий измеренный ответ: коробка со 128 ГБ unified-памяти уверенно
обслуживает MoE класса 35B, отдавая одному читателю первый токен ответа
быстрее чем за секунду, держит небольшую группу на пригодной задержке,
проходит документ в 32k токенов без драмы и работает так целый день, не
сдавая темпа. Чего она не покупает, так это самого крупного открытого
класса моделей — на него ушли две такие коробки, соединённые быстрым
линком, и швы были видны. Доказательства каждого пункта — ниже.

Почти всё, что публикуют об этом классе железа, отвечает на другой вопрос:
сколько памяти обещает спецификация и что в неё арифметически влезло бы.
Влезть — не значит обслуживать. Ниже то, что одна коробка на 128 ГБ —
Beelink GTR9 Pro с Ryzen AI Max+ 395 и Radeon 8060S, llama.cpp запинен по
digest образа — измеримо сделала на замороженных ворклоадах; каждая цифра
ведёт на свою страницу со скоупом, ограничениями и сырыми прогонами.

## Какой класс моделей она обслуживает и как это ощущается

Рабочая лошадка нашего реестра — Qwen3.6-35B-A3B в Q4_K_M, MoE класса 35B:
веса занимают заметно меньше трети памяти коробки, оставляя место под
контекст, кеш и вторую загруженную модель. На повседневных запросах она
отвечает за **210 ms** ([strix.qwen36.interactive2.c1.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c1.ttfa-nothink/))
и декодирует на
**15.9 ms/token** ([strix.qwen36q4.vulkan.c1.itl-nothink](https://agmind.ai/claims/strix.qwen36q4.vulkan.c1.itl-nothink/)) — темп, который
один читатель ощущает как беглую речь. Более тяжёлый квант Q8_0 тоже
влезает с запасом; что он покупает и чего нет —
[отдельный отчёт](https://agmind.ai/ru/reports/q8-0-vs-q4-k-m-strix-halo/).

Второе семейство моделей, gemma-4-26B-A4B, измерено на той же коробке в
[отчёте о заменах](https://agmind.ai/ru/reports/model-quant-backend-strix-halo/) — суть в
том, что на 128 ГБ смена семейства моделей — это решение о качестве и
поведении, а не о том, влезут ли веса.

## Длинные документы

Ёмкость памяти — только половина работы с длинным контекстом; вторая
половина — счёт за префилл. Первый вопрос по документу в 32k токенов стоит
на этой коробке
**33965 ms** ([strix.qwen36.longctx.c1.ttft-32k-en](https://agmind.ai/claims/strix.qwen36.longctx.c1.ttft-32k-en/)), а когда кеш
промпта llama.cpp делает своё дело, второй вопрос по тому же документу
обходится в
**860 ms** ([strix.qwen36.docsession.c1.ttft-q2-32k-cache](https://agmind.ai/claims/strix.qwen36.docsession.c1.ttft-q2-32k-cache/)). Разница
между процессом, который платит за заполнение один раз, и тем, который
платит на каждом запросе, —
[отдельная история](https://agmind.ai/ru/reports/llamacpp-prompt-cache-strix-halo/).

## Больше одного человека

При четырёх одновременных чатах медианное ожидание первого токена ответа —
**338 ms** ([strix.qwen36.interactive2.c4.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c4.ttfa-nothink/)), при
восьми — **865 ms** ([strix.qwen36.interactive2.c8.ttfa-nothink](https://agmind.ai/claims/strix.qwen36.interactive2.c8.ttfa-nothink/)), и
завершаемость держится на каждой ступени. Вся лестница и то, почему
запрос — не сотрудник, — в
[отчёте о ёмкости](https://agmind.ai/ru/reports/concurrency-capacity-strix-halo/).

## Целый день

Три непрерывных часа на конкурентности четыре сдвинули темп декода на
**1.6 %** ([strix.qwen36.endurance.c4.itl-drift-180m](https://agmind.ai/claims/strix.qwen36.endurance.c4.itl-drift-180m/)) между первыми
пятью минутами и последними — просадка под длительной нагрузкой, которую
предсказывают скептики мини-ПК,
[не пришла](https://agmind.ai/ru/reports/strix-halo-sustained-load-3-hours/) ни на одном из
двух наших одинаковых юнитов.

## Где 128 ГБ заканчиваются

Самый крупный открытый класс MoE в одну такую коробку не помещается. Чтобы
обслужить модель на 284B параметров, понадобились две коробки по 128 ГБ в
tensor parallel через быстрый линк, флаг рантайма, который автоматический
режим пропускает, и настоящая пусконаладка — измеренный рассказ в
[ответе покупателю DGX Spark](https://agmind.ai/ru/reports/dgx-spark-worth-it/) и
[таблицах бенчмарков пары](https://github.com/botAGI/dgx-spark-llm-benchmarks).
Одна коробка отлично обслуживает класс 35B; фронтирный класс — проект на
две коробки, со швами.

## Чего эта страница не утверждает

- **Коробка одного вендора, одно семейство рантаймов.** Другие
  unified-memory-машины на 128 ГБ — в первую очередь машины Apple —
  заявлены как дорожки на [наших стендах](https://agmind.ai/ru/testbed/), опубликованных
  прогонов по ним пока нет; на них мы не экстраполируем.
- **Никаких советов по ценам.** Цены на железо ходят; лаборатория их не
  публикует.
- **Меньшие ярусы здесь не измерены.** Что 8–24 ГБ VRAM делают с теми же
  ворклоадами — другое исследование: запланировано, не сделано.

У каждой цифры выше есть постоянная страница с сырыми прогонами в
[реестре клеймов](https://agmind.ai/ru/claims/); полные измеренные таблицы этой коробки — в
[репозитории бенчмарков Strix Halo](https://github.com/botAGI/strix-halo-llm-benchmarks).

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
