Ապացույցներ
Վերահսկվող համեմատություններ
«Ա-ն ընդդեմ Բ-ի» հարցեր, որոնց claim-երի ռեեստրը կարող է ազնվորեն պատասխանել. երկու կողմերը չափված են նույն յունիթի վրա, նույն սառեցված workload-ի տակ, փոխվել է մեկ փոփոխական։ Ամեն թիվ տանում է դեպի իր մշտական claim-էջը՝ գործարկումների ապացույցներով։
- llama.cpp Vulkan-ն ընդդեմ ROCm-ի AMD Strix Halo-ի վրա
llama.cpp-ի ո՞ր backend-ը գործարկել Ryzen AI Max+ 395 (gfx1151) մեքենայի վրա մեկ օգտատիրոջ չաթի համար — Vulkan, թե՞ ROCm։
Vulkan · ROCm
- Q4_K_M-ն ընդդեմ Q8_0-ի. ավելի մեծ քվանտն որևէ բա՞ն է գնում։
Արժե՞ արդյոք ծախսել լրացուցիչ հիշողությունը Qwen3.6-35B-A3B-ի Q8_0 արտեֆակտի վրա չաթի և JSON-ավտոմատացման համար Strix Halo-ի վրա։
Q4_K_M (20 ԳԲ) · Q8_0 (35 ԳԲ)
- Thinking-ն ընդդեմ no-thinking-ի. որքան արժե reasoning-ը չաթում
Թողնե՞լ reasoning-բլոկը միացրած առօրյա օգնականի խնդիրների համար լոկալ Qwen3.6-35B-A3B-ի վրա։
Reasoning-ն անջատած · Reasoning-ը միացրած (4096)
- Prompt cache-ը միացրած/անջատած. երկրորդ հարցը նույն փաստաթղթի շուրջ
Երկրորդ հարցը նույն տեղադրված փաստաթղթի շուրջ նորի՞ց է վճարում ամբողջ prefill-ը լոկալ llama.cpp սերվերի վրա։
Քեշը միացրած · Քեշն անջատած
- 2k պրոմպտն ընդդեմ 32k-ի. որքան արժե երկար կոնտեքստը մինչև առաջին թոքենը
Ինչո՞ւ է երկար փաստաթղթով սկսելն այդքան ավելի դանդաղ լոկալ llama.cpp սերվերի վրա, և որքանո՞վ։
2k թոքենանոց փաստաթուղթ · 32k թոքենանոց փաստաթուղթ
- Gemma 4-ն ընդդեմ Qwen 3.6-ի. ո՞րն է վերադարձնում դատարկ պատասխան սեղմ թոքեն-բյուջեի դեպքում։
Նույն առօրյա հարցումների և նույն 1024 թոքենանոց բյուջեի դեպքում ո՞ր մոդելն է բյուջեն ծախսում մտորումների վրա՝ ոչինչ չվերադարձնելով։
gemma-4-26B-A4B (կանխադրված ռեժիմ) · Qwen3.6-35B-A3B (reasoning-ը միացրած)