Վերահսկվող համեմատություն
2k պրոմպտն ընդդեմ 32k-ի. որքան արժե երկար կոնտեքստը մինչև առաջին թոքենը
Ինչո՞ւ է երկար փաստաթղթով սկսելն այդքան ավելի դանդաղ լոկալ llama.cpp սերվերի վրա, և որքանո՞վ։
Սպասումը մինչև առաջին թոքենն աճում է փաստաթղթի երկարության հետ. մոդելը կարդում է ամեն ինչ՝ նախքան որևէ բան ասելը, և prefill-ի հաշիվը մասշտաբավորվում է կարդացածով։ Որոնման որակն այս workload-ի վրա պահվեց երկու խորության վրա էլ։ Փրկօղակը prompt cache-ն է. կրկնվող պրեֆիքսը հաշիվը վճարում է մեկ անգամ, դրա համար նույն փաստաթղթի շուրջ երկրորդ հարցը վերադառնում է գրեթե ակնթարթորեն։
Ինչն էր ֆիքսված
Նույն յունիթը, backend-ը, արտեֆակտը, քվանտը և արշավը; փոխվում է միայն փաստաթղթի երկարությունը պրոմպտում։ Reasoning-ն անջատած, մեկ հոսք։
| Մետրիկա | 2k թոքենանոց փաստաթուղթ | 32k թոքենանոց փաստաթուղթ |
|---|---|---|
| Ժամանակ մինչև առաջին թոքենը, մեդիան | 1907մվmedian over valid 2k-band requests · lab_repeated · ապացույցներ | 33965մվmedian over valid 32k-band requests · lab_repeated · ապացույցներ |
Սահմանափակումներ
Չափված է 2k և 32k կետերում մեկ մոդելի ու քվանտի վրա — ոչ մի պնդում 32k-ից այն կողմ, և երկու կետի միջև կորը բնութագրված չէ։ Prefill-ով ծանր workload-ներն այլ backend-ների վրա կարող են այլ կերպ մասշտաբավորվել։
Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը
Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։