Վերահսկվող համեմատություն

Thinking-ն ընդդեմ no-thinking-ի. որքան արժե reasoning-ը չաթում

Թողնե՞լ reasoning-բլոկը միացրած առօրյա օգնականի խնդիրների համար լոկալ Qwen3.6-35B-A3B-ի վրա։

Ինչն էր ֆիքսված

Նույն յունիթը, backend-ը, արտեֆակտը և կորպուսները; փոխվում է միայն reasoning-փոխարկիչը (chat-template, 4096 թոքեն բյուջե միացրած վիճակում)։

Մետրիկա Reasoning-ն անջատած Reasoning-ը միացրած (4096)
Ժամանակ մինչև ՊԱՏԱՍԽԱՆԻ առաջին թոքենը, մեդիան (չաթ) 210մվmedian over valid requests · lab_unit_replicated · ապացույցներ 20191մվmedian over valid requests · lab_unit_replicated · ապացույցներ
Ամբողջական ժամանակ մինչև պատրաստի JSON պատասխանը, մեդիան 844մվmedian over valid requests · lab_repeated · ապացույցներ 14677մվmedian over valid requests · lab_repeated · ապացույցներ
Strict-JSON խնդիրների հաջողություն 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ

Ինչպես կարդալ սա

Այս առօրյա խնդիրների համար reasoning-ը սպասումը բազմապատկեց երկու կարգով և չբարելավեց ոչինչ, ինչ չափում են gate-երը. խնդիրների հաջողությունը նույնական է դրանով և առանց դրա։ Օգտատիրոջը տեսանելի տարբերությունն ակնթարթային օգնականն է՝ ընդդեմ պատասխանի առաջին թոքենից առաջ քսանվայրկյանանոց դադարի։

Սահմանափակումներ

Միայն առօրյա խնդիրների և strict-JSON կորպուսներ — reasoning-ը կարող է արդարանալ իսկապես բարդ խնդիրների վրա (մաթեմատիկա, բազմաքայլ պլանավորում), որոնք այս workload-ներում չկան։ Ծախսերի կողմն ընդհանուր է; օգուտի կողմը՝ սահմանափակ։

Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը

Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։

Առնչվող ապացույցներ

← Բոլոր համեմատությունները