Վերահսկվող համեմատություն
Q4_K_M-ն ընդդեմ Q8_0-ի. ավելի մեծ քվանտն որևէ բա՞ն է գնում։
Արժե՞ արդյոք ծախսել լրացուցիչ հիշողությունը Qwen3.6-35B-A3B-ի Q8_0 արտեֆակտի վրա չաթի և JSON-ավտոմատացման համար Strix Halo-ի վրա։
Ինչն էր ֆիքսված
Նույն յունիթը, Vulkan backend-ի նույն build-ը, նույն սառեցված կորպուսները, մեկ հոսք, reasoning-ն անջատած։ Տարբերվում է միայն մոդելի արտեֆակտը (երկուսն էլ ամրագրված են հեշերով)։
| Մետրիկա | Q4_K_M (20 ԳԲ) | Q8_0 (35 ԳԲ) |
|---|---|---|
| Միջթոքենային ուշացում, մեդիան (դեկոդի տեմպ) | 15.9մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ | 18.7մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ |
| Strict-JSON խնդիրների հաջողություն | 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ | 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ |
Ինչպես կարդալ սա
Այն workload-ների վրա, որոնք տեսնում են այս gate-երը, ավելի մեծ արտեֆակտն ոչինչ չգնեց. խնդիրների հաջողությունը նույնական է, իսկ Q8_0-ի դեկոդն ավելի դանդաղ է։ Եթե ձեր բեռը նման է սրանց, հիշողությունն ավելի օգտակար է ծախսել կոնտեքստի վրա։
Սահմանափակումներ
Որակի gate-երն այստեղ ֆորմատի/JSON-ի/կրկնությունների դասերն են. քվանտների տարբերությունը կարող էր երևալ ավելի բարդ reasoning-ի կամ բազմալեզու գեներացիայի վրա, որոնք այս workload-ները չեն զոնդավորում։ Բացասական արդյունք՝ սահմանափակված չափվածով։
Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը
Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։