Սյունակ

Անկախ ապացույց, թե չէ՝ չի եղել. DeepSeek-ը հենց նոր իր scoreboard-ը դրսից լրացվող դարձրեց

DeepSeek-ը բացեց իր ագենտային harness-ը և անվանեց V4-Pro-ի ագենտային միավորների հետևում կանգնած ռեժիմը, effort-ը և sampling-ը։ Սովորականից լավ բացահայտում, և դեռ ոչ ապացույց. վենդորի թիվը մնում է vendor_disclosed, մինչև երկրորդ կողմը նույն կոնֆիգը չքշի և trace-երը չհրապարակի։

կարծիք 02 սեպտեմբերի, 2026 թ.

Սա կարծիք-սյունակ է, ոչ թե լաբորատորիայի արդյունք։ Թվերն այստեղ հեղինակի աշխատանքային օրագրից և մեջբերված արտաքին աղբյուրներից են (նշված են տեքստում), երբեք՝ claim-երի ռեեստրից։ Չափված, ապացույցներով արդյունքներն ապրում են /claims/.

Ամիսներ շարունակ frontier մոդելի ագենտային միավորի հետ վիճել կարելի էր, բայց քշել այն՝ ոչ։ Մոդելը բաց էր՝ երբեմն; բենչմարկը հրապարակային էր՝ սովորաբար; scaffold-ը, որը մոդելն ագենտ էր դարձնում, վենդորի փակ գործիքն էր՝ միշտ։ Օգոստոսին այդ արդարացումը մեկ լաբորատորիայի համար ավարտվեց։ DeepSeek-ը V4-Pro-ի release build-ը թողարկեց MIT լիցենզիայով, բացեց ագենտային harness-ը, որով իր միավորներն է հաշվում՝ նույնպես MIT, և մոդելի քարտում գրեց, թե ինչպես են ստացվել code-agent տողերը. «Վերը նշված հրապարակային բենչմարկների code-agent առաջադրանքների համար DeepSeek-V4-Pro-0813-ը գնահատվում է DeepSeek Harness-ի minimal ռեժիմով՝ որպես ագենտային framework, max reasoning effort մակարդակով և temperature = 1.0, top_p = 0.95-ով»։

Այդ նախադասությունն ավելին է ասում, քան քարտերի մեծ մասը, և ես ուզում եմ, որ դա արձանագրված լինի մնացածից առաջ։ Մեր սեփական պլանավորման գրառումն այս էսսեն դրել էր «V4-Pro-ի դատարկ scoreboard-ը — վենդորի բենչմարկներ, չափված վենդորի սեփական, չթողարկված harness-ում» վերնագրի տակ։ Այդ տողն օգոստոսին չդիմացավ, և ես ուրախ եմ այն թոշակի ուղարկել։ Framework-ն անվանված է, ռեժիմն անվանված է, effort-ի ամենաբարձր մակարդակն անվանված է, sampling-ն անվանված է։ Սովորական scoreboard-ը տալիս է թավ թիվ և տողատակ, որտեղ գրված է «internal»։

Սա դեռ ապացույց չէ, և պատճառն ազնվության հետ կապ չունի։ Scoreboard-ի տողը կոնֆիգուրացիա է, և ամեն թիվ քողարկված կոնֆիգ է։ Գրի առեք, թե ինչից է կախված ագենտային բենչմարկի մեկ տողը։ Harness-ի commit-ը. ռեպոզիտորիան developer preview է, որը breaking change-ներ է խոստանում, ուրեմն «DeepSeek Harness»-ն առանց հեշի շարժվող թիրախ է անվանում։ Պլագինների հավաքածուն, քանի որ ճարտարապետությունը «ամեն ինչ պլագին է» սկզբունքով է, իսկ թե ինչ է մտնում «minimal ռեժիմի» մեջ, սահմանում է harness-ը, ոչ թե քարտը։ Գործիքների sandbox-ը, որի ներսում ագենտն աշխատել է։ Effort-ի մակարդակն ու sampling-ը, որոնք քարտն իսկապես տալիս է։ Սպասարկման ստեկն այս ամենի տակ. runtime-ի build-ը, քվանտացումը և սպեկուլյատիվ դեկոդինգի մոդուլը, որը նրանք DSpark են անվանում և որը նույնպես տարբերակ ունի։ Բենչմարկի սեփական տարբերակը։ Եվ հում trace-երը՝ հարցում առ հարցում, որ այդ ընտրություններից յուրաքանչյուրը թողել է իր հետևից։ Քարտը հրապարակում է այդ ցուցակի վերին մասը։ Ցուցակից թիվ վերահաշվել ոչ ոք չի կարող։ Մենք մոդելի քարտի աղյուսակի հետևում հրապարակված trace-եր փնտրեցինք և չգտանք; ռեպոզիտորիայում կա BENCHMARK.md, որը ես դեռ ծայրեծայր չեմ անցել, ուստի սա կարդացեք որպես հարց, ոչ թե վճիռ։

Սպասարկման ստեկի մասին ես տեսականորեն չեմ խոսում։ Մենք փոքր եղբորը՝ V4-Flash-ը, սպասարկում ենք մի զույգ DGX Spark-ի վրա, և «մոդելը» մեր ոտքի տակ փոխվեց՝ առանց մեկ կշռի փոփոխության։ Ես սա արդեն պատմել եմ. միջուկի դրոշակ, որն ավտոմատ ռեժիմը բաց է թողնում, և որտեղ իմանալու միակ ձևը, թե որ շերտում ես հայտնվել, սերվերի լոգի մի տողն էր, և հրապարակված արագությունների մի հավաքածու այդ մոդելի համար այդ երկու տուփի վրա, որոնցից յուրաքանչյուրը կարող էր ճիշտ լինել, հենց որ ամրացվի իր սեփական կարգավորումներին։ Միջադեպը, որը դեռ չեմ պատմել, այդ տուփերից մեկից է՝ ուրիշ MoE մոդել քշելիս. քվանտացման ուղին կոտրված էր mainline build-ում, որը մենք թեստավորեցինք, և կիսով չափ բայթերով checkpoint-ն իր FP8 եղբորից ավելի դանդաղ էր դեկոդում։ Scoreboard-ի տողն այս ամենը ժառանգում է։ Որակի տողերն այն ավելի լուռ են ժառանգում, որովհետև սխալ միջուկն իր մասին հայտնում է թողունակությամբ, իսկ sampling-ի սխալ դեֆոլտը՝ ոչնչով։

Ամեն քարտ ու հաշվետվություն, որ մենք հրապարակում ենք, կրում է ապացույցի մակարդակ՝ սանդուղք, թե որքան չափում է կանգնած թվի հետևում. մեկ վավեր գործարկում, կրկնություններ նույն յունիթի վրա, երկրորդ նույնական յունիթ, վերարտադրում լաբորատորիայից դուրս։ Մի կողմում, սանդուղքից դուրս, նստած է vendor_disclosed-ը։ Վենդորի թիվն այնտեղ մնում է ընդմիշտ։ Վենդորը կարող է գործարկումը կրկնել այնքան, որքան ուզում է, և թիվն այնտեղ է մնում, որովհետև նույն շահագրգռությամբ նույն կողմի կրկնությունը մեկ տվյալային կետ է՝ ավելի խոշոր տառաչափով։ Այն բարձրանում է, երբ մեկ ուրիշը՝ բոլորովին այլ շահով, քշում է նույն կոնֆիգուրացիան և հրապարակում trace-երը։ Մինչև այս օգոստոս դա մոդելների այս ընտանիքի համար կառուցվածքորեն անհնար էր։ Հիմա դա ընդամենը չվճարվող աշխատանք է։ Անկախ գնահատողներ կան. Artificial Analysis-ը մոդելը max effort-ով ցուցակում է իր Intelligence Index-ում՝ մի քանի գնահատումների տարբերակավորված կոմպոզիտում։ Լավ է։ Կոմպոզիտ ինդեքսը նույնպես կոնֆիգուրացիա է՝ երրորդ կողմի ընտրած, իր սեփական scaffold-ով, ուրեմն այն ուրիշ տող է, ոչ թե վենդորի տողի վերարտադրում։ Վենդորի տողը՝ վենդորի harness-ում, անվանված commit-ի վրա, կցված trace-երով, դեռ դատարկ է։ Ով առաջինն այն լրացնի, այդ թվի տերը կլինի։

Հիմա՝ նույն չափանիշը, կիրառված մեզ վրա։ Մենք V4-Pro-ն քշել չենք կարող։ Մեր զույգը Flash եղբորն է պահում tensor-parallel-ով երկու նոդի վրա, իսկ Pro-ին այդ հիշողության բազմապատիկը կպահանջվեր; «մենք այն գնահատեցինք»-ի ազնիվ տարբերակն այս լաբորատորիայի համար «չգնահատեցինք»-ն է։ DGX գիծը նաև bring-up աշխատանք է. այն, ինչ այդ էջերն են տալիս, հրապարակային գործարկումների ռեպոզիտորիա է՝ մանիֆեստով և հում ելքերով, գումարած նշում ամեն մեկի վրա, որ սրանից ոչինչ claim-ռեեստրին չի հասել։ Տողը, որը մենք կարող ենք ամբողջությամբ լրացնել, ռեեստրի գիծն է՝ փաթեթով, որն ամեն մեկին պետք է թիվը վերահաշվելու համար։ Այնտեղ ամեն գործարկում թողնում է մանիֆեստ, հարցում առ հարցում գրառումներ՝ ձախողումները դեռ ներսում, սերվերի լոգը և չեքսումներ այս ամենի վրա։ Image-ի digest-ը, մոդելի ռևիզիան և կորպուսի հեշը մանիֆեստում նստած են կարգավորումների կողքին, իսկ հոսթի գույքագրումը վերցվում է սկզբում և նորից վերջում, այնպես որ հոսթի հանդարտությունը դառնում է ստուգում, որը կարող է ձախողվել, ոչ թե տող ծանոթագրություններում։ Հրապարակված թվերը CI-ում վերաստացվում են այդ գրառումներից, իսկ մշտական առաջարկն այն է, որ ամեն ոք, ով ցուցակված claim-ի համար քշում է kit-ը և ուղարկում համընկնող փաթեթ, այն բարձրացնում է մինչև external_reproduced, մինչդեռ չհամընկնող փաթեթը հրապարակվում է որպես շեղում և հետաքննվում բոլորի աչքի առաջ։

Բաց harness-ը «վստահեք մեզ»-ը դարձնում է «քշեք ինքներդ»։ Ուրիշ շահագրգռությամբ և բավարար հիշողությամբ ինչ-որ մեկը դեռ պետք է հրամանը մուտքագրի՝ այն commit-ի վրա, որը քարտը չի անվանում։ Մինչև այդ scoreboard-ը խոստում է՝ գերազանց փաստաթղթավորմամբ։

← Բոլոր սյունակները