Վերահսկվող համեմատություն

Gemma 4-ն ընդդեմ Qwen 3.6-ի. ո՞րն է վերադարձնում դատարկ պատասխան սեղմ թոքեն-բյուջեի դեպքում։

Նույն առօրյա հարցումների և նույն 1024 թոքենանոց բյուջեի դեպքում ո՞ր մոդելն է բյուջեն ծախսում մտորումների վրա՝ ոչինչ չվերադարձնելով։

Նույն սեղմ բյուջեի դեպքում ավելի երկար մտորող մոդելը շատ ավելի հաճախ է սպառում տեղը՝ ոչինչ չասած։ Երկու ազդանշանն էլ գալիս է որպես HTTP 200. միայն ստատուս-կոդը կարդացող կլիենտը երկու դեպքում էլ հաջողություն է տեսնում։ Qwen-ի կողմում դեղը reasoning-ն անջատելն է. այս կորպուսի վրա դա ամբողջովին վերացնում է ձախողումը։

Ինչն էր ֆիքսված

Նույն յունիթը, backend-ը, կորպուսը և 1024 թոքենանոց բյուջեն։ Ռեժիմը յուրաքանչյուր մոդելի գործարանային reasoning-վարքն է. gemma-4-ը՝ կանխադրված ռեժիմում, Qwen3.6-ը՝ reasoning-ը միացրած։ Սա դեֆոլտների համեմատություն է ճնշման տակ, ոչ թե նույնական կարգավորումների։

Մետրիկա gemma-4-26B-A4B (կանխադրված ռեժիմ) Qwen3.6-35B-A3B (reasoning-ը միացրած)
Դատարկ պատասխաններ HTTP 200-ի տակ (answerless), հարցումների բաժինը 8.3հարցումների %share of all issued requests · lab_repeated · ապացույցներ 58.3հարցումների %share of all issued requests · lab_unit_replicated · ապացույցներ
Ժամանակ մինչև որևէ բանի առաջին թոքենը, մեդիան 282մվmedian over answered requests · lab_repeated · ապացույցներ 212մվmedian over all valid requests of three cells · lab_unit_replicated · ապացույցներ
Ժամանակ մինչև ՊԱՏԱՍԽԱՆԻ առաջին թոքենը, մեդիան 10768մվmedian over answered requests · lab_repeated · ապացույցներ 20191մվmedian over valid requests · lab_unit_replicated · ապացույցներ

Սահմանափակումներ

Մեկ բյուջե, մեկ կորպուս, դեֆոլտներն ընդդեմ դեֆոլտների. gemma-4-ը ճնշված reasoning-ով չի փորձարկվել, և ավելի մեծ բյուջեն փոխում է երկու թիվն էլ։ Այստեղ չափված է, թե ինչպես են ձախողվում գործարանային կոնֆիգուրացիաները, ոչ թե որ մոդելն է ավելի խելացի։

Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը

Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։

Առնչվող ապացույցներ

← Բոլոր համեմատությունները