Ի՞նչ հարցի է պատասխանում քարտը
Արձագանքո՞ւն է արդյոք մեկ օգտատիրոջ հոսքային չաթը այս ճշգրիտ կոնֆիգուրացիայի վրա առօրյա մարդկային խնդիրների համար — հաղորդագրություններ, նամակներ, երեխային բացատրություններ, պլաններ։
Վճիռը՝ PARTIAL։ Կոնֆիգուրացիան մաքուր անցնում է աշխատանքի մի ռեժիմում, կառուցվածքորեն ձախողվում է մյուսում, և որակի մեկ գեյթ ամբողջությամբ չի անցնում ոչ մի ռեժիմում։ Մանրամասները հենց պրոդուկտն են. ահա դրանք։
Ինչն է անցնում
Chat template-ի միջոցով անջատված մտածողության բլոկով պատասխանի առաջին թոքենը գալիս է 210մվunit_replicated մեդիանով — պատասխանը սկսվում է հոսքի հետ միասին, իսկ պատասխանով ավարտված հարցումների բաժինը երկու յունիթի վրա վեց կրկնական անցումներում՝ 100.0հարցումների %unit_replicated՝ լեզվի և կրկնությունների գեյթերն անցած վիճակում։
Ինչն է ձախողվում
Միացված մտածողությամբ, 1024 թոքեն բյուջեի դեպքում, կենցաղային հարցումների 58.3հարցումների %unit_replicated վերադարձրել է HTTP 200՝ դատարկ պատասխանով. մտածողության անցումը կերել է ամբողջ բյուջեն մինչև պատասխանի սկիզբը։ Ստատուսի կոդերը ստուգող հավելվածը դրանք գրանցում է որպես հաջողություն։
Բյուջեն մինչև 4096 թոքեն բարձրացնելը վերացնում է դատարկ պատասխանները, բայց պատասխանի առաջին թոքենն այդ դեպքում գալիս է 20191մվunit_replicated մեդիանով — տասնյակ վայրկյանների տեսանելի «մտածողություն»՝ նախքան «հարևանուհուն գրիր երկու նախադասությունից բաղկացած հաղորդագրություն» տիպի հարցման պատասխանը։
Ընդ որում կոնվենցիոն time-to-first-token-ը հավասար է 212մվunit_replicated բոլոր երեք ռեժիմներում — այն չի տարբերում աշխատող կոնֆիգուրացիան կոտրվածից։ Ամբողջական վերլուծությունը՝ Time-to-first-token-ը չի նկարագրում thinking-մոդելը հաշվետվության մեջ։
Ինչը ոչ մի տեղ չի անցնում
Հարցումի բառաքանակի բյուջեն. երկու ռեժիմներում էլ, որտեղ պատասխաններն ընդհանրապես հասնում են — առանց մտածողության և 4096 բյուջեով — պատասխանների նկատելի մասը գերազանցում էր այն երկարությունը, որը խնդրում էր փրոմփթը։ (1024 բյուջեի դեպքում ֆորմատի ձախողումները հենց դատարկ պատասխաններն են։) Այս բազմախոսությունը մոդելի հատկությունն է այս կորպուսի վրա, և հենց դրա պատճառով քարտը չի ստացել PASS WITH LIMITS։
Ռեպլիկացված է երկրորդ յունիթի վրա
Բոլոր երեք մեկ օգտատիրոջ բջիջները կրկին անցկացվել են երկրորդ՝ կոմերցիոն առումով նույնական GTR9 Pro-ի վրա՝ բիթ-առ-բիթ նույն մոդելի արտեֆակտով. պատկերը վերարտադրվել է (ակնթարթային պատասխաններ առանց մտածողության, դատարկների մեծամասնություն 1024 բյուջեի դեպքում, տասնյակ վայրկյաններ 4096-ի դեպքում), և վերևի մեկ օգտատիրոջ թվերը դուրս են բերվել երկու յունիթներով։ Դետալ, որն ավելացրել է ռեպլիկացիան. երկրորդ յունիթի վրա 48 հարցումից մեկը սպառել է նույնիսկ 4096 թոքենի բյուջեն — ավելի մեծ բյուջեն նվազեցնում է դատարկ պատասխանի ռիսկը, բայց չի վերացնում այն։
Զուգահեռ բեռնվածության տակ (closed loop)
Անջատված մտածողությամբ և 4 միաժամանակյա հոսքով պատասխանի առաջին թոքենի մեդիանը տեղաշարժվում է մինչև 338մվrepeated. 8 հոսքով՝ մինչև 865մվrepeated — ավարտման բաժինը՝ համապատասխանաբար 100.0հարցումների %repeated և 100.0հարցումների %repeated։ Սա closed-loop չափում է (յուրաքանչյուր վիրտուալ օգտատեր սպասում է իր պատասխանին, նախքան նորից հարցնելը) — այն ցույց է տալիս, թե ինչ է զգում N միաժամանակյա օգտատերերից յուրաքանչյուրը, և սա ոչ թողունակության կամ SLO-ի մասին հայտարարություն է։
Շահագործման տիրույթն ըստ տվյալների
Այս կոնֆիգուրացիայի վրա կենցաղային օգնականի դերի համար. անջատեք մտածողության բլոկը — կամ նախատեսեք առնվազն 4096 թոքեն բյուջե և ընդունեք սպասումը։ Մի՛ գործարկեք «մտածողությունը միացված + 1024 թոքեն» լռելյայն համադրությունը. մոնիթորինգում դատարկ պատասխանները հաշվեք որպես սխալներ։
Ինչը կփոխի վճիռը
Առանց մտածողության ռեժիմում պատասխանների որակի գնահատումը (այստեղ չի ստուգվել — հավանաբար ավելի վատ է), 8-ից բարձր concurrency-ն և runtime-ի կամ մոդելի արտեֆակտի թարմացումը — սրանցից ցանկացածը գործարկում է ռեվալիդացիա։ Հում ապացույցների փաթեթները և harness-ը բաց են. agmind-bench, մեթոդաբանությունը՝ ապացույցների և տվյալների էջում։