Отчёт

Что реально запускают 128 ГБ unified-памяти: локальные LLM, измерено

Класс 128 ГБ unified-памяти — нынешняя золотая середина локальных LLM-коробок, и почти всё написанное о нём — спековая арифметика. Вот что одна такая коробка измеримо делает: какой класс моделей обслуживает, как быстро, для скольких людей и где 128 ГБ заканчиваются.

lab_repeated internal research 20 августа 2026 г. · Финансирование: Собственное финансирование, внутреннее исследование

Короткий измеренный ответ: коробка со 128 ГБ unified-памяти уверенно обслуживает MoE класса 35B, отдавая одному читателю первый токен ответа быстрее чем за секунду, держит небольшую группу на пригодной задержке, проходит документ в 32k токенов без драмы и работает так целый день, не сдавая темпа. Чего она не покупает, так это самого крупного открытого класса моделей — на него ушли две такие коробки, соединённые быстрым линком, и швы были видны. Доказательства каждого пункта — ниже.

Почти всё, что публикуют об этом классе железа, отвечает на другой вопрос: сколько памяти обещает спецификация и что в неё арифметически влезло бы. Влезть — не значит обслуживать. Ниже то, что одна коробка на 128 ГБ — Beelink GTR9 Pro с Ryzen AI Max+ 395 и Radeon 8060S, llama.cpp запинен по digest образа — измеримо сделала на замороженных ворклоадах; каждая цифра ведёт на свою страницу со скоупом, ограничениями и сырыми прогонами.

Какой класс моделей она обслуживает и как это ощущается

Рабочая лошадка нашего реестра — Qwen3.6-35B-A3B в Q4_K_M, MoE класса 35B: веса занимают заметно меньше трети памяти коробки, оставляя место под контекст, кеш и вторую загруженную модель. На повседневных запросах она отвечает за 210мсunit_replicated и декодирует на 15.9мс/токенrepeated — темп, который один читатель ощущает как беглую речь. Более тяжёлый квант Q8_0 тоже влезает с запасом; что он покупает и чего нет — отдельный отчёт.

Второе семейство моделей, gemma-4-26B-A4B, измерено на той же коробке в отчёте о заменах — суть в том, что на 128 ГБ смена семейства моделей — это решение о качестве и поведении, а не о том, влезут ли веса.

Длинные документы

Ёмкость памяти — только половина работы с длинным контекстом; вторая половина — счёт за префилл. Первый вопрос по документу в 32k токенов стоит на этой коробке 33965мсrepeated, а когда кеш промпта llama.cpp делает своё дело, второй вопрос по тому же документу обходится в 860мсrepeated. Разница между процессом, который платит за заполнение один раз, и тем, который платит на каждом запросе, — отдельная история.

Больше одного человека

При четырёх одновременных чатах медианное ожидание первого токена ответа — 338мсrepeated, при восьми — 865мсrepeated, и завершаемость держится на каждой ступени. Вся лестница и то, почему запрос — не сотрудник, — в отчёте о ёмкости.

Целый день

Три непрерывных часа на конкурентности четыре сдвинули темп декода на 1.6%single_run между первыми пятью минутами и последними — просадка под длительной нагрузкой, которую предсказывают скептики мини-ПК, не пришла ни на одном из двух наших одинаковых юнитов.

Где 128 ГБ заканчиваются

Самый крупный открытый класс MoE в одну такую коробку не помещается. Чтобы обслужить модель на 284B параметров, понадобились две коробки по 128 ГБ в tensor parallel через быстрый линк, флаг рантайма, который автоматический режим пропускает, и настоящая пусконаладка — измеренный рассказ в ответе покупателю DGX Spark и таблицах бенчмарков пары. Одна коробка отлично обслуживает класс 35B; фронтирный класс — проект на две коробки, со швами.

Чего эта страница не утверждает

У каждой цифры выше есть постоянная страница с сырыми прогонами в реестре клеймов; полные измеренные таблицы этой коробки — в репозитории бенчмарков Strix Halo.

Связанные проверенные конфигурации

Как цитировать

AGmind Systems Lab (2026-08-20). Что реально запускают 128 ГБ unified-памяти: локальные LLM, измерено. Evidence level: lab_repeated. https://agmind.ai/ru/reports/what-128gb-unified-memory-runs/
← Отчёты