Վերահսկվող համեմատություն
Thinking-ն ընդդեմ no-thinking-ի. որքան արժե reasoning-ը չաթում
Թողնե՞լ reasoning-բլոկը միացրած առօրյա օգնականի խնդիրների համար լոկալ Qwen3.6-35B-A3B-ի վրա։
Ինչն էր ֆիքսված
Նույն յունիթը, backend-ը, արտեֆակտը և կորպուսները; փոխվում է միայն reasoning-փոխարկիչը (chat-template, 4096 թոքեն բյուջե միացրած վիճակում)։
| Մետրիկա | Reasoning-ն անջատած | Reasoning-ը միացրած (4096) |
|---|---|---|
| Ժամանակ մինչև ՊԱՏԱՍԽԱՆԻ առաջին թոքենը, մեդիան (չաթ) | 210մվmedian over valid requests · lab_unit_replicated · ապացույցներ | 20191մվmedian over valid requests · lab_unit_replicated · ապացույցներ |
| Ամբողջական ժամանակ մինչև պատրաստի JSON պատասխանը, մեդիան | 844մվmedian over valid requests · lab_repeated · ապացույցներ | 14677մվmedian over valid requests · lab_repeated · ապացույցներ |
| Strict-JSON խնդիրների հաջողություն | 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ | 100.0հարցումների %share of all issued requests · lab_repeated · ապացույցներ |
Ինչպես կարդալ սա
Այս առօրյա խնդիրների համար reasoning-ը սպասումը բազմապատկեց երկու կարգով և չբարելավեց ոչինչ, ինչ չափում են gate-երը. խնդիրների հաջողությունը նույնական է դրանով և առանց դրա։ Օգտատիրոջը տեսանելի տարբերությունն ակնթարթային օգնականն է՝ ընդդեմ պատասխանի առաջին թոքենից առաջ քսանվայրկյանանոց դադարի։
Սահմանափակումներ
Միայն առօրյա խնդիրների և strict-JSON կորպուսներ — reasoning-ը կարող է արդարանալ իսկապես բարդ խնդիրների վրա (մաթեմատիկա, բազմաքայլ պլանավորում), որոնք այս workload-ներում չկան։ Ծախսերի կողմն ընդհանուր է; օգուտի կողմը՝ սահմանափակ։
Ինչ-որ տեղ պատասխանո՞ւմ եք այս հարցին։ Տեղադրեք աղյուսակը
Markdown, ռենդերվում է GitHub-ում / Reddit-ում / ֆորումներում։ Ատրիբուցիայի տողը ներսում է — տվյալները CC BY 4.0 են, վերցրեք։