Հաշվետվություն

Քանի՞ թոքեն վայրկյանում է բավարար լոկալ LLM-ի համար

Լոկալ AI-ի ամենահաճախ տրվող և ամենաքիչ չափված հարցը, որին սովորաբար պատասխանում են հորինված կլոր թվերով։ Ահա թե ինչ է արագությունն իրապես զգացվում իրական տուփի վրա. սպասումը մինչև առաջին օգտակար բառը, հոսքը դրանից հետո և ձախողումը, որը ցանկացած tok/s թիվ դարձնում է անիմաստ։

lab_repeated internal research 20 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Ազնիվ պատասխանը. «բավարարը» մեկ թիվ չէ, որովհետև հարցի տակ թաքնված են երեք առանձին փորձառություններ — որքան սպասել մինչև առաջին օգտակար բառը, ինչ արագ է տեքստը հոսում դրանից հետո, և այն, թե ընդհանրապես կգա՞ պատասխան։ Ֆորումները պատասխանում են կլոր շեմերով, որոնք ոչ ոք չի չափել։ Ահա թե ինչ է ամեն փորձառությունն իրապես մեկ իրական տուփի վրա, որտեղ ամեն թիվ կրում է իր կոնֆիգուրացիան։

Ինչու է մեկ tok/s թիվը սխալ ոսպնյակ

Թողունակության մեկ թիվը միջինացնում է այն երկու բանը, որ մարդն իրապես զգում է. դադարը, մինչև որևէ բան կհայտնվի, և տեմպը, երբ արդեն հայտնվել է։ Միջին tok/s-ով նույնական երկու կարգավորում կարող են զգացվել ակնթարթային կամ կոտրված՝ կախված նրանից, թե որտեղ է նստած ժամանակը։ Ավելի վատ. շրջանառվող ամենատարածված արագության թիվը — դեկոդի tok/s-ը սինթետիկ բենչմարքից — իրական պրոմպտի տակ այս երկու փորձառությունից ոչ մեկը չի չափում։ Ուստի հարցը բաժանեք այնպես, ինչպես ընկալումն է բաժանում։

Որքա՞ն սպասել մինչև առաջին օգտակար բառը

Առօրյա հարցումների վրա reasoning-ն անջատած՝ այս տուփն իր առաջին պատասխան-թոքենը ցույց է տալիս 210մվunit_replicated-ում — այն շեմից ցածր, որից սկսած մարդն ընդհանրապես սպասում է նկատում։ Նույն մոդելը reasoning-ը միացրած մինչև առաջին տեսանելի բառը պահանջում է 20191մվunit_replicated, մինչդեռ որևէ բանի առաջին թոքենին հետևող միամիտ դաշբորդը կհաղորդեր 212մվunit_replicated — որովհետև մտորումների հոսքը մեկնարկում է ակնթարթորեն և ուղղված չէ ձեզ։ Եթե այս էջից մեկ մեթոդ եք տանելու. չափեք մինչև պատասխանի առաջին թոքենը, այլապես ձեր մետրիկան ձեզ կստի։

Ինչ արագ պիտի հոսի պատասխանը

Ընթերցանության տեմպը բնական չափանիշն է. տեքստը, որը գալիս է ավելի արագ, քան կարդում եք, զգացվում է սահուն, ավելի դանդաղը՝ որպես թելադրություն։ Այս տուփը առօրյա կորպուսի վրա դեկոդում է 15.9մվ/թոքենrepeated-ով — ընթերցանության տեմպից հանգիստ առաջ։ Կոնֆիգուրացիան այս թիվը շարժում է ավելի շատ, քան սարքաշարային նախանձը. ավելի ծանր Q8_0 քվանտը դանդաղեցնում է այն մինչև 18.7մվ/թոքենrepeated, իսկ ROCm backend-ը՝ մինչև 18.7մվ/թոքենrepeatedքվանտի և backend-ի ընտրություններն ավելին արժեն, քան upgrade-ի պլանների մեծ մասը։

Կդիմանա՞ արագությունը զուգահեռությանն ու ժամանակին

Մենակ, առաջին րոպեին վերցրած թվերը շոյում են տուփին։ Չորս միաժամանակյա չաթի տակ առաջին պատասխան-թոքենը դեռ գալիս է 338մվrepeated-ում; ութի դեպքում՝ 865մվrepeatedամբողջ սանդուղքը հենց այն է, ինչով չափավորում են ընդհանուր տուփը։ Իսկ երեք ժամ շարունակական սպասարկման ընթացքում դեկոդի տեմպը շեղվեց 1.6%single_run-ով — արագություն, որը աշխատանքային օրվա հետ չի մարում։

Երբ արագությունը դադարում է կարևոր լինել

Մոդելը կարող է արագ լինել և միևնույնն է ոչինչ չտալ. սեղմ թոքեն-բյուջեով, reasoning-ը միացրած, այս տուփը հարցումների 58.3հարցումների %unit_replicated-ը վերադարձրեց որպես HTTP 200՝ դատարկ պատասխանով — բյուջեն գնաց մտորումների վրա, ձեզ՝ ոչինչ։ Մեկ այլ մոդելային ընտանիք իր կանխադրված ռեժիմում նույն կորպուսի վրա ցույց տվեց 8.3հարցումների %repeated։ Սա ոչ մի tok/s թիվ չի բռնում, հենց դրա համար չափում ենք առանձին — և հենց դրա համար արագության խոսակցությունը, որ սա անտեսում է, թերի է։

Ուրեմն ի՞նչ է «բավարարը»

Մենակ չաթի համար այս դասի սարքաշարի վրա. վերևի տուփն արդեն անցել է այն կետը, որտեղ արագությունը խցանն է — առաջին բառը ընկալման շեմից ցածր, հոսքը ընթերցանության տեմպից առաջ։ Ընդհանուր տուփի համար զուգահեռության սանդուղքը կարդացեք ձեր օգտատերերի հանդուրժելիք սպասման դիմաց։ Ավտոմատացման համար մետրիկան ամբողջական ժամանակն է մեկ ավարտված, վերլուծելի պատասխանի հաշվով — չափված այստեղ։ Իսկ reasoning-ը միացրած ցանկացած կարգավորման համար նախ բյուջե դրեք խափանման ռեժիմի, հետո՝ թողունակության համար։

Եթե որևէ էջ այս չափումների փոխարեն ձեզ առաջարկում է մեկ ունիվերսալ tok/s շեմ, այն մեջբերում է տրամադրություն։ Ձեր սեփական տուփը չափելու մեթոդը գրված է այստեղ; վերևի ամեն թիվ ունի մշտական էջ՝ հում գործարկումներով, ռեեստրում։

Առնչվող ստուգված կոնֆիգուրացիաներ

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-20). Քանի՞ թոքեն վայրկյանում է բավարար լոկալ LLM-ի համար. Evidence level: lab_repeated. https://agmind.ai/hy/reports/how-many-tokens-per-second-is-enough/
← Հաշվետվություններ