Հաշվետվություն

Q8_0, թե՞ Q4_K_M. ինչ է ավելի մեծ քվանտն իրականում տալիս՝ չափված մեկ տուփի վրա

Նույն մոդելը, նույն llama.cpp build-ը, նույն Strix Halo տուփը, փոխվել է միայն քվանտավորումը. ինչ է Q8_0-ն արժենում դեկոդի տեմպով Q4_K_M-ի դիմաց, ինչ տեսան մեր որակի gate-երը, և որ պակասը պետք է իրականում որոշի ընտրությունը։

lab_repeated internal research 16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Կարճ պատասխանը վերահսկվող բջիջից. ավելի մեծ քվանտը ոչինչ չգնեց, որ մեր որակի gate-երը կարողանային նկատել, իսկ դեկոդում է ավելի դանդաղ։ Այս տուփի վրա, այս workload-ների համար Q4_K_M-ը հաղթում է երկու հաշվով էլ։ Երկար պատասխանը՝ թվերով և դրանց սահմաններով, ստորև է։

Ամեն լոկալ LLM համայնք այս վեճը շաբաթը մեկ նորից է բացում։ Ինչ-որ մեկը ներբեռնում է մոդել, տեսնում է վեց քվանտ-ֆայլ, հարցնում է՝ ո՞րը, և ստանում ինքնավստահ պատասխանների պատ՝ հենված այլ սարքաշարից, այլ մոդելներից քաղված perplexity-աղյուսակների վրա — կամ ոչնչի։ Ինչ թելը գրեթե երբեք չի պարունակում՝ նույն մոդելը, չափված երկու քվանտով նույն մեքենայի վրա, երբ մնացած ամեն ինչ սառեցված է։ Հենց դա է այս էջը։

Վերահսկվող բջիջը

Մեկ Beelink GTR9 Pro, Ryzen AI Max+ 395՝ 128 ԳԲ unified հիշողությամբ։ llama.cpp server, Vulkan backend, build-ն ամրագրված image-ի digest-ով։ Qwen3.6-35B-A3B նույն արտեֆակտային ընտանիքից՝ մեկ անգամ Q4_K_M, մեկ անգամ Q8_0, յուրաքանչյուրն ամրագրված հեշով։ Նույն workload-ները, նույն gate-երը, երեքական կրկնված անցում, reasoning-ն անջատած։ Քվանտավորումը միակ փոփոխականն է։

Q8_0-ն ավելի դանդա՞ղ է, քան Q4_K_M-ը

Դեկոդի տեմպն այն է, որտեղ քվանտը զգացվում է ամբողջ օրը, ուստի սկսենք այնտեղից։ Q4_K_M-ն ընթանում է 15.9մվ/թոքենrepeated-ով։ Q8_0-ն նույն backend-ի վրա՝ 18.7մվ/թոքենrepeated-ով։

Ավելի մեծ կշիռներն ամեն թոքենի համար նույն հիշողության միջով ավելի շատ բայթ են մղում, իսկ unified-memory տուփի վրա հիշողության թողունակությունն է առաստաղը։ Դուք դա վճարում եք ամեն պատասխանի ամեն թոքենի վրա, ընդմիշտ։ Երկու տեմպն էլ պիտանի են մեկ ընթերցողի համար; ճեղքն իրական է և մշտական։

Կողմնակի դիտարկում backend-ներով հետաքրքրվողների համար. Q8_0-ն Vulkan-ի վրա ընկնում է նույն տեմպի վրա, ինչ Q4_K_M-ը ROCm-ի վրա՝ 18.7մվ/թոքենrepeated, — սխալ backend ընտրելն արժե մոտավորապես նույնքան, որքան կշիռների կրկնապատկումը։ Այդ պատմությունը շարունակվում է backend-ների համեմատության մեջ։

Q8_0-ն որակով գերազանցո՞ւմ է Q4_K_M-ին

Մեր gate-երի վրա՝ ոչինչ նկատելի։ Խիստ JSON ավտոմատացումը — workload-ը, որտեղ դեգրադացված կշիռներն առաջինը երևում են որպես չպարսվող ելք և սխալ պիտակներ — անցավ 100.0հարցումների %repeated-ով Q4_K_M-ի վրա և 100.0հարցումների %repeated-ով Q8_0-ի վրա։ Նույնական։ Ֆորմատի, լեզվի և կրկնությունների gate-երն ինտերակտիվ կորպուսի վրա. նույնպես ոչ մի տարբերություն։

Կարդացեք այդ պնդումն այնքան նեղ, որքան այն գրված է։ Մեր gate-երը ստուգում են՝ ելքը պարսվո՞ւմ է, համընկնո՞ւմ է ground truth-ի հետ փակ պիտակների բազմությունների վրա, մնո՞ւմ է ճիշտ լեզվի մեջ առանց ցիկլերի։ Դրանք reasoning-բենչմարք չեն, գիտելիքի զոնդ չեն, և ոչինչ չեն ասում որակի այն նուրբ տարբերությունների մասին, որ երկար արձակը կարող էր ի հայտ բերել։ Ինչ դրանք հաստատում են. կոշտ ճիշտ պատասխան ունեցող խնդիրների վրա այս մոդելը Q4_K_M-ում Q8_0-ին հաղթելու ոչինչ չթողեց։

Ո՞ր քվանտն ընտրել՝ Q8_0, թե՞ Q4_K_M

Որոշեք ըստ այն բանի, ինչի պակաս ունեք։ Հիշողության պակաս՝ Q4_K_M, և սա մարդկանց մեծ մասն է։ Q8_0 արտեֆակտը դիսկի վրա և հիշողության մեջ էապես ավելի ծանր է, ինչը փոքր տուփերի վրա հարցը փակում է դեռ նախքան որակը ձայն կստանա, և նույնիսկ 128 ԳԲ-ի դեպքում կարող է որոշել՝ կողքին երկրորդ մոդել կտեղավորվի՞, թե՞ ոչ։ Համբերության պակաս՝ կրկին Q4_K_M, և սա անհարմար գտածոն է։ «Գործարկիր ամենամեծ քվանտը, որը տեղավորվում է» լռելյայն խորհուրդը ձեր դեկոդի տեմպը ծախսում է որակի մի տարբերության վրա, որը մեր կոշտ պատասխանով gate-երը չկարողացան նկատել։ Եթե ձեր workload-ը երկար արձակ է, որտեղ նրբերանգն իրոք կարող է տարբեր լինել, երկուսի միջով անցկացրեք ձեր սեփական կորպուսը — harness-ը բաց է։

Ինչ սա ՉԻ ասում

Ամբողջական մատրիցը երկու քվանտով և երկու backend-ով՝ համեմատության էջում, քվանտ × backend փոխազդեցության խորը վերլուծությունը՝ քվանտի և backend-ի հաշվետվության մեջ։ Վերևի ամեն թիվ ունի մշտական էջ՝ շրջանակով և հում գործարկումներով. claim-երի ռեեստրը։

Առնչվող ստուգված կոնֆիգուրացիաներ

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-16). Q8_0, թե՞ Q4_K_M. ինչ է ավելի մեծ քվանտն իրականում տալիս՝ չափված մեկ տուփի վրա. Evidence level: lab_repeated. https://agmind.ai/hy/reports/q8-0-vs-q4-k-m-strix-halo/
← Հաշվետվություններ