Доказательства
Проверенные конфигурации
Одна карточка = одна точная система, runtime, артефакт модели и ревизия workload, с вердиктом ровно для этой комбинации. Карточка никогда не означает поддержку других версий того же устройства.
- PASS WITH LIMITS active lab_repeatedStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — кэш сессии документа
Второй вопрос по тому же вставленному документу: с выключенным кэшем промптов он заново платит полуминутный префилл; с включённым — отвечает быстрее секунды. Одна настройка превращает работу с документами из непригодной в живую.
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
- Runtime:
- llama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
- Модель:
- Qwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
- Workload:
- doc-session-v1 @ 2026-08-03 — пары вопросов с общим префиксом над документами 8k/32k токенов, EN+RU
- PASS WITH LIMITS active lab_single_runStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — три часа под непрерывной нагрузкой
Непрерывный 3-часовой closed-loop проход при конкуренции 4 на обоих юнитах: все запросы отвечены, темп декода удержан между первыми и последними пятью минутами, без теплового обвала — при заметно разной температуре кристалла у двух юнитов.
- Система:
- 2× Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified — по одному проходу на юнит, бок о бок
- Runtime:
- llama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
- Модель:
- Qwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
- Workload:
- endurance-30m-v1 @ 2026-08-03 — human-корпус по кругу closed-loop 180 минут, чекпоинты 30/60/180 мин
- PARTIAL active lab_repeatedStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — бытовой ассистент
Однопользовательский бытовой чат на Beelink GTR9 Pro: мгновенные ответы без размышления, сломанная конфигурация на дефолтном бюджете размышления и лимит многословности, который не проходится ни в одном режиме.
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified — однопользовательские ячейки реплицированы на втором коммерчески идентичном юните
- Runtime:
- llama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
- Модель:
- Qwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
- Workload:
- interactive-assistant-v2 @ 2026-08-02 — 16 бытовых задач, EN+RU
- PASS WITH LIMITS active lab_repeatedStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — поиск по вставленному документу
Иголочная лестница контекста до 30k измеренных токенов с unanswerable-контролями: и поиск, и честность держатся на всех измеренных глубинах — а время до первого токена растёт линейно до десятков секунд.
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
- Runtime:
- llama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
- Модель:
- Qwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
- Workload:
- long-context-v1 @ 2026-08-03 — иголочная лестница, номинальные ступени 2k–32k (EN измерено 1.8k–30.0k, RU 1.4k–21.1k), с контролями
- PASS WITH LIMITS active lab_repeatedStrix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — строгий JSON для автоматизаций
Детерминированное извлечение, классификация и структурная генерация в строгом JSON: идеальный task-success в обоих режимах размышления на этом корпусе — при семнадцатикратной разнице во времени между ними.
- Система:
- Beelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
- Runtime:
- llama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
- Модель:
- Qwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
- Workload:
- structured-agent-v1 @ 2026-08-03 — 16 детерминированных JSON-задач, EN+RU