Վերահսկվող համեմատություն
Gemma 4-ն ընդդեմ Qwen 3.6-ի. ո՞րն է վերադարձնում դատարկ պատասխան սեղմ թոքեն-բյուջեի դեպքում։
Նույն առօրյա հարցումների և նույն 1024 թոքենանոց բյուջեի դեպքում ո՞ր մոդելն է բյուջեն ծախսում մտորումների վրա՝ ոչինչ չվերադարձնելով։
Նույն սեղմ բյուջեի դեպքում ավելի երկար մտորող մոդելը շատ ավելի հաճախ է սպառում տեղը՝ ոչինչ չասած։ Երկու ազդանշանն էլ գալիս է որպես HTTP 200. միայն ստատուս-կոդը կարդացող կլիենտը երկու դեպքում էլ հաջողություն է տեսնում։ Qwen-ի կողմում դեղը reasoning-ն անջատելն է. այս կորպուսի վրա դա ամբողջովին վերացնում է ձախողումը։
Ինչն էր ֆիքսված
Նույն յունիթը, backend-ը, կորպուսը և 1024 թոքենանոց բյուջեն։ Ռեժիմը յուրաքանչյուր մոդելի գործարանային reasoning-վարքն է. gemma-4-ը՝ կանխադրված ռեժիմում, Qwen3.6-ը՝ reasoning-ը միացրած։ Սա դեֆոլտների համեմատություն է ճնշման տակ, ոչ թե նույնական կարգավորումների։
| Մետրիկա | gemma-4-26B-A4B (կանխադրված ռեժիմ) | Qwen3.6-35B-A3B (reasoning-ը միացրած) |
|---|---|---|
| Դատարկ պատասխաններ HTTP 200-ի տակ (answerless), հարցումների բաժինը | 8.3հարցումների %share of all issued requests · lab_repeated · ապացույցներ | 58.3հարցումների %share of all issued requests · lab_unit_replicated · ապացույցներ |
| Ժամանակ մինչև որևէ բանի առաջին թոքենը, մեդիան | 282մվmedian over answered requests · lab_repeated · ապացույցներ | 212մվmedian over all valid requests of three cells · lab_unit_replicated · ապացույցներ |
| Ժամանակ մինչև ՊԱՏԱՍԽԱՆԻ առաջին թոքենը, մեդիան | 10768մվmedian over answered requests · lab_repeated · ապացույցներ | 20191մվmedian over valid requests · lab_unit_replicated · ապացույցներ |
Սահմանափակումներ
Մեկ բյուջե, մեկ կորպուս, դեֆոլտներն ընդդեմ դեֆոլտների. gemma-4-ը ճնշված reasoning-ով չի փորձարկվել, և ավելի մեծ բյուջեն փոխում է երկու թիվն էլ։ Այստեղ չափված է, թե ինչպես են ձախողվում գործարանային կոնֆիգուրացիաները, ոչ թե որ մոդելն է ավելի խելացի։
Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը
Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։