Կարճ պատասխանը վերահսկվող բջիջից. ավելի մեծ քվանտը ոչինչ չգնեց, որ մեր որակի gate-երը կարողանային նկատել, իսկ դեկոդում է ավելի դանդաղ։ Այս տուփի վրա, այս workload-ների համար Q4_K_M-ը հաղթում է երկու հաշվով էլ։ Երկար պատասխանը՝ թվերով և դրանց սահմաններով, ստորև է։
Ամեն լոկալ LLM համայնք այս վեճը շաբաթը մեկ նորից է բացում։ Ինչ-որ մեկը ներբեռնում է մոդել, տեսնում է վեց քվանտ-ֆայլ, հարցնում է՝ ո՞րը, և ստանում ինքնավստահ պատասխանների պատ՝ հենված այլ սարքաշարից, այլ մոդելներից քաղված perplexity-աղյուսակների վրա — կամ ոչնչի։ Ինչ թելը գրեթե երբեք չի պարունակում՝ նույն մոդելը, չափված երկու քվանտով նույն մեքենայի վրա, երբ մնացած ամեն ինչ սառեցված է։ Հենց դա է այս էջը։
Վերահսկվող բջիջը
Մեկ Beelink GTR9 Pro, Ryzen AI Max+ 395՝ 128 ԳԲ unified հիշողությամբ։ llama.cpp server, Vulkan backend, build-ն ամրագրված image-ի digest-ով։ Qwen3.6-35B-A3B նույն արտեֆակտային ընտանիքից՝ մեկ անգամ Q4_K_M, մեկ անգամ Q8_0, յուրաքանչյուրն ամրագրված հեշով։ Նույն workload-ները, նույն gate-երը, երեքական կրկնված անցում, reasoning-ն անջատած։ Քվանտավորումը միակ փոփոխականն է։
Q8_0-ն ավելի դանդա՞ղ է, քան Q4_K_M-ը
Դեկոդի տեմպն այն է, որտեղ քվանտը զգացվում է ամբողջ օրը, ուստի սկսենք այնտեղից։ Q4_K_M-ն ընթանում է 15.9մվ/թոքենrepeated-ով։ Q8_0-ն նույն backend-ի վրա՝ 18.7մվ/թոքենrepeated-ով։
Ավելի մեծ կշիռներն ամեն թոքենի համար նույն հիշողության միջով ավելի շատ բայթ են մղում, իսկ unified-memory տուփի վրա հիշողության թողունակությունն է առաստաղը։ Դուք դա վճարում եք ամեն պատասխանի ամեն թոքենի վրա, ընդմիշտ։ Երկու տեմպն էլ պիտանի են մեկ ընթերցողի համար; ճեղքն իրական է և մշտական։
Կողմնակի դիտարկում backend-ներով հետաքրքրվողների համար. Q8_0-ն Vulkan-ի վրա ընկնում է նույն տեմպի վրա, ինչ Q4_K_M-ը ROCm-ի վրա՝ 18.7մվ/թոքենrepeated, — սխալ backend ընտրելն արժե մոտավորապես նույնքան, որքան կշիռների կրկնապատկումը։ Այդ պատմությունը շարունակվում է backend-ների համեմատության մեջ։
Q8_0-ն որակով գերազանցո՞ւմ է Q4_K_M-ին
Մեր gate-երի վրա՝ ոչինչ նկատելի։ Խիստ JSON ավտոմատացումը — workload-ը, որտեղ դեգրադացված կշիռներն առաջինը երևում են որպես չպարսվող ելք և սխալ պիտակներ — անցավ 100.0հարցումների %repeated-ով Q4_K_M-ի վրա և 100.0հարցումների %repeated-ով Q8_0-ի վրա։ Նույնական։ Ֆորմատի, լեզվի և կրկնությունների gate-երն ինտերակտիվ կորպուսի վրա. նույնպես ոչ մի տարբերություն։
Կարդացեք այդ պնդումն այնքան նեղ, որքան այն գրված է։ Մեր gate-երը ստուգում են՝ ելքը պարսվո՞ւմ է, համընկնո՞ւմ է ground truth-ի հետ փակ պիտակների բազմությունների վրա, մնո՞ւմ է ճիշտ լեզվի մեջ առանց ցիկլերի։ Դրանք reasoning-բենչմարք չեն, գիտելիքի զոնդ չեն, և ոչինչ չեն ասում որակի այն նուրբ տարբերությունների մասին, որ երկար արձակը կարող էր ի հայտ բերել։ Ինչ դրանք հաստատում են. կոշտ ճիշտ պատասխան ունեցող խնդիրների վրա այս մոդելը Q4_K_M-ում Q8_0-ին հաղթելու ոչինչ չթողեց։
Ո՞ր քվանտն ընտրել՝ Q8_0, թե՞ Q4_K_M
Որոշեք ըստ այն բանի, ինչի պակաս ունեք։ Հիշողության պակաս՝ Q4_K_M, և սա մարդկանց մեծ մասն է։ Q8_0 արտեֆակտը դիսկի վրա և հիշողության մեջ էապես ավելի ծանր է, ինչը փոքր տուփերի վրա հարցը փակում է դեռ նախքան որակը ձայն կստանա, և նույնիսկ 128 ԳԲ-ի դեպքում կարող է որոշել՝ կողքին երկրորդ մոդել կտեղավորվի՞, թե՞ ոչ։ Համբերության պակաս՝ կրկին Q4_K_M, և սա անհարմար գտածոն է։ «Գործարկիր ամենամեծ քվանտը, որը տեղավորվում է» լռելյայն խորհուրդը ձեր դեկոդի տեմպը ծախսում է որակի մի տարբերության վրա, որը մեր կոշտ պատասխանով gate-երը չկարողացան նկատել։ Եթե ձեր workload-ը երկար արձակ է, որտեղ նրբերանգն իրոք կարող է տարբեր լինել, երկուսի միջով անցկացրեք ձեր սեփական կորպուսը — harness-ը բաց է։
Ինչ սա ՉԻ ասում
- Մեկ մոդելային ընտանիք։ Փոքր ակտիվ բազմությամբ MoE մոդելները լայնորեն համարվում են նրբանկատորեն քվանտավորվող; խիտ մոդելը Q8_0-ի համար կարող է այլ կերպ հատուցել։ Չափել ենք այս մոդելը և պնդում ենք միայն նրա մասին։
- Ոչ perplexity, ոչ accuracy-փաթեթներ։ Միտումնավոր. այդ թվերը վատ են ճամփորդում սարքաշարերի ու թոքենայզերների միջով։ Ground truth-ով խնդիր-gate-երն ավելի կոպիտ են և ավելի ազնիվ։
- Մեկ տուփ, մեկ build։ Տեմպի ճեղքի ձևը պետք է պահպանվի թողունակությամբ սահմանափակված ցանկացած unified-memory մեքենայի վրա; ճշգրիտ թվերը միայն այս տուփինն են։
Ամբողջական մատրիցը երկու քվանտով և երկու backend-ով՝ համեմատության էջում, քվանտ × backend փոխազդեցության խորը վերլուծությունը՝ քվանտի և backend-ի հաշվետվության մեջ։ Վերևի ամեն թիվ ունի մշտական էջ՝ շրջանակով և հում գործարկումներով. claim-երի ռեեստրը։