Վերահսկվող համեմատություն

2k պրոմպտն ընդդեմ 32k-ի. որքան արժե երկար կոնտեքստը մինչև առաջին թոքենը

Ինչո՞ւ է երկար փաստաթղթով սկսելն այդքան ավելի դանդաղ լոկալ llama.cpp սերվերի վրա, և որքանո՞վ։

Սպասումը մինչև առաջին թոքենն աճում է փաստաթղթի երկարության հետ. մոդելը կարդում է ամեն ինչ՝ նախքան որևէ բան ասելը, և prefill-ի հաշիվը մասշտաբավորվում է կարդացածով։ Որոնման որակն այս workload-ի վրա պահվեց երկու խորության վրա էլ։ Փրկօղակը prompt cache-ն է. կրկնվող պրեֆիքսը հաշիվը վճարում է մեկ անգամ, դրա համար նույն փաստաթղթի շուրջ երկրորդ հարցը վերադառնում է գրեթե ակնթարթորեն։

Ինչն էր ֆիքսված

Նույն յունիթը, backend-ը, արտեֆակտը, քվանտը և արշավը; փոխվում է միայն փաստաթղթի երկարությունը պրոմպտում։ Reasoning-ն անջատած, մեկ հոսք։

Մետրիկա 2k թոքենանոց փաստաթուղթ 32k թոքենանոց փաստաթուղթ
Ժամանակ մինչև առաջին թոքենը, մեդիան 1907մվmedian over valid 2k-band requests · lab_repeated · ապացույցներ 33965մվmedian over valid 32k-band requests · lab_repeated · ապացույցներ

Սահմանափակումներ

Չափված է 2k և 32k կետերում մեկ մոդելի ու քվանտի վրա — ոչ մի պնդում 32k-ից այն կողմ, և երկու կետի միջև կորը բնութագրված չէ։ Prefill-ով ծանր workload-ներն այլ backend-ների վրա կարող են այլ կերպ մասշտաբավորվել։

Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը

Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։

Առնչվող ապացույցներ

← Բոլոր համեմատությունները