Короткий измеренный ответ: коробка со 128 ГБ unified-памяти уверенно обслуживает MoE класса 35B, отдавая одному читателю первый токен ответа быстрее чем за секунду, держит небольшую группу на пригодной задержке, проходит документ в 32k токенов без драмы и работает так целый день, не сдавая темпа. Чего она не покупает, так это самого крупного открытого класса моделей — на него ушли две такие коробки, соединённые быстрым линком, и швы были видны. Доказательства каждого пункта — ниже.
Почти всё, что публикуют об этом классе железа, отвечает на другой вопрос: сколько памяти обещает спецификация и что в неё арифметически влезло бы. Влезть — не значит обслуживать. Ниже то, что одна коробка на 128 ГБ — Beelink GTR9 Pro с Ryzen AI Max+ 395 и Radeon 8060S, llama.cpp запинен по digest образа — измеримо сделала на замороженных ворклоадах; каждая цифра ведёт на свою страницу со скоупом, ограничениями и сырыми прогонами.
Какой класс моделей она обслуживает и как это ощущается
Рабочая лошадка нашего реестра — Qwen3.6-35B-A3B в Q4_K_M, MoE класса 35B: веса занимают заметно меньше трети памяти коробки, оставляя место под контекст, кеш и вторую загруженную модель. На повседневных запросах она отвечает за 210мсunit_replicated и декодирует на 15.9мс/токенrepeated — темп, который один читатель ощущает как беглую речь. Более тяжёлый квант Q8_0 тоже влезает с запасом; что он покупает и чего нет — отдельный отчёт.
Второе семейство моделей, gemma-4-26B-A4B, измерено на той же коробке в отчёте о заменах — суть в том, что на 128 ГБ смена семейства моделей — это решение о качестве и поведении, а не о том, влезут ли веса.
Длинные документы
Ёмкость памяти — только половина работы с длинным контекстом; вторая половина — счёт за префилл. Первый вопрос по документу в 32k токенов стоит на этой коробке 33965мсrepeated, а когда кеш промпта llama.cpp делает своё дело, второй вопрос по тому же документу обходится в 860мсrepeated. Разница между процессом, который платит за заполнение один раз, и тем, который платит на каждом запросе, — отдельная история.
Больше одного человека
При четырёх одновременных чатах медианное ожидание первого токена ответа — 338мсrepeated, при восьми — 865мсrepeated, и завершаемость держится на каждой ступени. Вся лестница и то, почему запрос — не сотрудник, — в отчёте о ёмкости.
Целый день
Три непрерывных часа на конкурентности четыре сдвинули темп декода на 1.6%single_run между первыми пятью минутами и последними — просадка под длительной нагрузкой, которую предсказывают скептики мини-ПК, не пришла ни на одном из двух наших одинаковых юнитов.
Где 128 ГБ заканчиваются
Самый крупный открытый класс MoE в одну такую коробку не помещается. Чтобы обслужить модель на 284B параметров, понадобились две коробки по 128 ГБ в tensor parallel через быстрый линк, флаг рантайма, который автоматический режим пропускает, и настоящая пусконаладка — измеренный рассказ в ответе покупателю DGX Spark и таблицах бенчмарков пары. Одна коробка отлично обслуживает класс 35B; фронтирный класс — проект на две коробки, со швами.
Чего эта страница не утверждает
- Коробка одного вендора, одно семейство рантаймов. Другие unified-memory-машины на 128 ГБ — в первую очередь машины Apple — заявлены как дорожки на наших стендах, опубликованных прогонов по ним пока нет; на них мы не экстраполируем.
- Никаких советов по ценам. Цены на железо ходят; лаборатория их не публикует.
- Меньшие ярусы здесь не измерены. Что 8–24 ГБ VRAM делают с теми же ворклоадами — другое исследование: запланировано, не сделано.
У каждой цифры выше есть постоянная страница с сырыми прогонами в реестре клеймов; полные измеренные таблицы этой коробки — в репозитории бенчмарков Strix Halo.