Проверенная конфигурация

Strix Halo × llama.cpp Vulkan × Qwen3.6-35B-A3B — строгий JSON для автоматизаций

Детерминированное извлечение, классификация и структурная генерация в строгом JSON: идеальный task-success в обоих режимах размышления на этом корпусе — при семнадцатикратной разнице во времени между ними.

PASS WITH LIMITS active lab_repeated

Точный отпечаток конфигурации

СистемаBeelink GTR9 Pro — Ryzen AI Max+ 395, Radeon 8060S (gfx1151), 128 ГБ unified
Runtimellama.cpp server-vulkan-b9049, зафиксирован digest образа sha256:e359c012…
МодельQwen3.6-35B-A3B Q4_K_M (ggml-org, пиненная ревизия, sha256:671e47e0…)
Workloadstructured-agent-v1 @ 2026-08-03 — 16 детерминированных JSON-задач, EN+RU
Режимinternal research
ФинансированиеСобственное финансирование, внутреннее исследование

Вердикт относится только к точной конфигурации и ревизии workload выше. Он не означает поддержку других версий прошивки, драйвера, runtime или модели того же устройства.

На какой вопрос отвечает карточка

Надёжен ли строгий JSON-вывод для повседневных автоматизаций — извлечь поля из сообщения, классифицировать отзыв, выдать структурный план — на этой точной конфигурации?

Вердикт: PASS WITH LIMITS. Каждый ответ в каждом повторе распарсился как строгий JSON и совпал с эталоном по ключам, в обоих режимах размышления. Лимиты реальные и перечислены ниже.

Что мерили

Шестнадцать детерминированных задач, EN и RU: извлечение с точным ожидаемым объектом (имена, даты, отрицательные температуры, булевы — включая кириллические значения за латинскими ключами), классификация по закрытым наборам меток и генерация со структурным контрактом. Гейт срезает code fences, парсит строго и сверяет обязательные ключи с эталоном. Ошибка парсинга и неверное значение различимы в записях — parse и task success считаются раздельно.

Результаты

Task success с отключённым размышлением: 100.0% запросовrepeated — и с включённым при бюджете 4096 токенов ровно то же: 100.0% запросовrepeated.

Разница — во времени. Полный валидный ответ занимает медиану 844мсrepeated без размышления против 14677мсrepeated с ним — на этом корпусе проход размышления не купил измеримой корректности и стоил примерно семнадцатикратно во времени.

Лимиты в «pass with limits»

Триггеры ревалидации

Смена образа runtime, артефакта модели, ревизии ворклоада (особенно sandbox-цикл агента), драйвера/ядра. Харнесс и корпус открыты: agmind-bench.

← Проверенные конфигурации