Վերահսկվող համեմատություն

Q4_K_M-ն ընդդեմ Q8_0-ի. ավելի մեծ քվանտն որևէ բա՞ն է գնում։

Արժե՞ արդյոք ծախսել լրացուցիչ հիշողությունը Qwen3.6-35B-A3B-ի Q8_0 արտեֆակտի վրա չաթի և JSON-ավտոմատացման համար Strix Halo-ի վրա։

Ինչն էր ֆիքսված

Նույն յունիթը, Vulkan backend-ի նույն build-ը, նույն սառեցված կորպուսները, մեկ հոսք, reasoning-ն անջատած։ Տարբերվում է միայն մոդելի արտեֆակտը (երկուսն էլ ամրագրված են հեշերով)։

Մետրիկա Q4_K_M (20 ԳԲ) Q8_0 (35 ԳԲ)
Միջթոքենային ուշացում, մեդիան (դեկոդի տեմպ) 15.9մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ 18.7մվ/թոքենmedian over valid requests · lab_repeated · ապացույցներ
Strict-JSON խնդիրների հաջողություն 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ

Ինչպես կարդալ սա

Այն workload-ների վրա, որոնք տեսնում են այս gate-երը, ավելի մեծ արտեֆակտն ոչինչ չգնեց. խնդիրների հաջողությունը նույնական է, իսկ Q8_0-ի դեկոդն ավելի դանդաղ է։ Եթե ձեր բեռը նման է սրանց, հիշողությունն ավելի օգտակար է ծախսել կոնտեքստի վրա։

Սահմանափակումներ

Որակի gate-երն այստեղ ֆորմատի/JSON-ի/կրկնությունների դասերն են. քվանտների տարբերությունը կարող էր երևալ ավելի բարդ reasoning-ի կամ բազմալեզու գեներացիայի վրա, որոնք այս workload-ները չեն զոնդավորում։ Բացասական արդյունք՝ սահմանափակված չափվածով։

Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը

Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։

Առնչվող ապացույցներ

← Բոլոր համեմատությունները