Ապացույցների մակարդակը՝
lab_repeated։ Ստորև բերված յուրաքանչյուր թիվ նորից դուրս է բերվում հարցումների հում գրառումներից հենց այն հարցումով, որը նշված է claim registry-ում, — ոչ մեկը ձեռքով գրված չէ այս էջում։ Խորությունը ախտորոշիչ է. երեք չափված անցում մեկ ռեժիմին, concurrency 1, մեկ միավոր։ Սա հետազոտություն է, որն ապացուցում է կոնվեյերի աշխատունակությունը դրոշակակիր չափումից առաջ, ոչ թե բուն դրոշակակիրը։ Երկրորդ միավորի վրա ռեպլիկացիայով թվերը դուրս կգան սառեցված պրեռեգիստրացիայի հետ միասին։
Կարճ ասած
Մոդելը, որը մտածում է պատասխանելուց առաջ, կոտրում է այն մետրիկան, որը բոլորը մեջբերում են։
Փորձարկված կոնֆիգուրացիայի վրա մինչև առաջին թոքենի սովորական ժամանակը գերազանց տեսք ունի՝ վայրկյանի հինգերորդ մասը։ Բայց այդ առաջին թոքենը մտորման թոքեն է։ Բուն պատասխանի առաջին թոքենը գալիս է մոտ հարյուր անգամ ավելի ուշ, իսկ տարածված թոքենային բյուջեի դեպքում հարցումների մեծ մասն ընդհանրապես պատասխան չի տալիս. կանչող կողմը ստանում է HTTP 200 և դատարկ տող։
Բենչմարկում, որը հաշվետու է լինում թոքեն/վայրկյան ցուցանիշով, սա տեսանելի չէ։
Ինչ էր չափվում
| Ինքնություն | Արժեք |
|---|---|
| Համակարգ | Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S / gfx1151, 128 ԳԲ unified) |
| Runtime | llama.cpp server-vulkan-b9049, ամրագրված պատկերի digest-ով |
| Մոդել | Qwen3.6-35B-A3B Q4_K_M ggml-org-ից, ներբեռնված ամրագրված ռևիզիայով և ստուգված հեշով |
| Workload | interactive-assistant-v1 @ 2026-08-02 — 16 սառեցված պրոմպտ, EN և RU, երկարության երեք տիրույթ |
| Բջիջ | concurrency 1, կոնտեքստ 8192, temperature 0, prompt cache-ն անջատված |
Չափումը կլիենտային է. վայրկյանաչափը մեկնարկում է հարցումի ուղարկման պահին
և ժամանակը վերցնում է թոքենների վրա՝ ըստ դրանց ժամանման։ Սերվերային
timings-ը կթաքցներ հենց այն էֆեկտը, որին նվիրված է այս հաշվետվությունը։
Յուրաքանչյուր հարցում կրում է եզակի աղ, prompt cache-ն անջատված է — ոչինչ չի
պատասխանվում նախորդ հարցումի աշխատանքի հաշվին։
Անցկացվել են երեք ռեժիմ՝ փոխելով մեկ բան միանգամից.
- մտորումը միացված է, բյուջեն՝ 1024 թոքեն;
- մտորումը միացված է, բյուջեն՝ 4096 թոքեն;
- մտորումն անջատված է chat template-ի միջոցով, բյուջեն՝ 1024 թոքեն։
Արդյունքներ
Առաջին թոքենի սովորական թիվը նույնն է բոլոր երեք ռեժիմներում՝ մոտ 221մվrepeated։ Այն չի տարբերում կոնֆիգուրացիան, որն անմիջապես պատասխանում է, նրանից, որը երբեք չի պատասխանում։
Միացված մտորման դեպքում պատասխանը սկսվում է շատ ավելի ուշ։ 4096 բյուջեի դեպքում պատասխանի առաջին թոքենը գալիս է 23453մվrepeated մեդիանով։ Այս ամբողջ ընթացքում օգտվողը նայում է թոքենների հոսքին — մոդելը բարձրաձայն մտածում է, ոչ թե պատասխանում։
Ավելի փոքր բյուջեի դեպքում հարցումների մեծ մասը պատասխան չտվեց։ Միացված մտորմամբ և 1024 թոքեն բյուջեով հարցումների 75.0հարցումների %repeated-ը վերադարձրին հաջող HTTP պատասխան՝ դատարկ բովանդակությամբ. մտորումը կերավ ամբողջ բյուջեն նախքան պատասխանի սկսվելը։ Հավելվածը, որը նայում է միայն ստատուս-կոդերին, դրանք կգրանցեր հաջողվածների շարքում։
Մտորման անջատումը փակում է ճեղքը։ Անջատված մտորման բլոկով պատասխանի առաջին թոքենը գալիս է 220մվrepeated-ում — պատասխանը սկսվում է հոսքի հետ միասին։ Մեդիանային ծայրից ծայր ժամանակը նվազեց մոտ հինգ անգամ՝ մտորմամբ և 4096 բյուջեով բջջի համեմատ, իսկ պատասխանները նախկինի պես անցան լեզվի և կրկնությունների գեյթերը։
Մեկ գեյթ չանցավ ոչ մի ռեժիմում։ Պատասխանների կեսը դուրս եկավ պրոմպտի համար հայտարարված բառերի բյուջեից։ Սա մոդելի շատախոսության հատկությունն է, ոչ թե մտորման ռեժիմի, — և հենց դրա համար կոնֆիգուրացիան այս workload-ի վրա անվերապահ pass չէր ստանա։
Ինչ է սա նշանակում գործնականում
- Առաջին թոքենի թիվն առանց սահմանման անօգուտ է։ Հարցրեք՝ ո՞ր թոքենն է դա. հոսքի առաջինը, թե պատասխանին պատկանող առաջինը։ Մտածող մոդելի վրա սրանք երկու տարբեր հարցեր են՝ հարյուր անգամ տարբերությամբ։
- Թոքենային բյուջեն կոռեկտության կարգավորում է, ոչ միայն արժեքի։ Մտորման անցումին անհրաժեշտ բյուջեից ցածր endpoint-ը վերադարձնում է հաջողություն և դատարկություն։ Մոնիտորինգը, որը հետևում է միայն ստատուս-կոդերին, սա չի նկատի։
- Դատարկ պատասխանները ձեր error rate-ի մասն են։ Այս հետազոտության մեջ դրանք հաշվվել են որպես մերժումներ և մնում են ուշացման յուրաքանչյուր մետրիկայի հայտարարում։
Ինչ սա չի հաստատում
Սա հզորության մասին պնդում չէ. միայն concurrency 1։ Որակի վճիռ չէ. գեյթերը
ծածկում են ձևաչափը, լեզուն և կրկնությունները, ոչ թե կոռեկտությունը։ Սարքի
մասին պնդում չէ. մեկ միավոր, պատկերի մեկ digest, մեկ արտեֆակտ։ Կրկնված է,
բայց ոչ ռեպլիկացված. մեկ միավորի վրա երեք չափված անցում մեկ ռեժիմին — հենց
դրա համար ապացույցների մակարդակը lab_repeated է, և operating envelope
այստեղ չի առաջարկվում։ Արժե՞ արդյոք մտորման անջատումը պատասխանների որակի
կորուստը — չի ստուգվել. հավանաբար այո, և դա առանձին որակավորում է։
Ապացույցներ
Յուրաքանչյուր անցում ստեղծել է փաթեթ՝ ամբողջական ինքնությամբ մանիֆեստ, գրառումներ յուրաքանչյուր հարցումի համար՝ ներառյալ մերժումները, գեյթերի արդյունքներ, runtime-ի լոգ և ստուգիչ գումարների ֆայլ։ Հաշվետվության թվերը նորից դուրս են բերվում այս գրառումներից SQL հարցումներով, որոնք գտնվում են claims-ի կողքին. build-ն ընկնում է, եթե ռենդերված արժեքը դադարում է համընկնել իր ապացույցի հետ։ Ինչպես է դա կառուցված — ապացույցների և տվյալների էջում։