Սյունակ
Էսսեներ
Լաբորատորիայի օպերատորի կարծիք-սյունակները. աշխատանքային նոթեր AI-ի ամենօրյա օգտագործման մասին — ինչն է կոտրվում, ինչն է արդարանում, և ինչ է դրա մասին ասում պատմությունը։ Կարծիքներ, ոչ չափումներ — չափված արդյունքներն ապրում են claim-երի ռեեստրում։
- Մենք մեր բենչմարքը վերաշարադրեցինք, որ մարդու պես հնչի
Մեր առաջին չաթ-կորպուսը մոդելին հարցնում էր build digest-ի ու goodput-ի մասին։ Ոչ մեկի օգտատերերն այդպիսի բան չեն հարցնում։ Նույն բջիջը՝ վերաչափված տասնվեց առօրյա պրոմպտով, նույն երկաթի վրա ձախողումների ուրիշ բաժին տվեց, և հին թիվը միևնույն է պահեցինք։
02 սեպտեմբերի, 2026 թ.
- Կայք, որտեղ CI-ն ձախողվում է, երբ թիվը շեղվում է իր ապացույցից
Մուտքագրեք վայրկյանում թոքենների թիվ այս կայքում, և CI-ն կձախողվի։ Ամեն չափված արժեք նորից է արտածվում գործարկումների հում գրառումներից, և դրանցից շեղված commit-ված արժեքը կանգնեցնում է խողովակաշարը։ Ինչպես է աշխատում gate-ը, ինչ է պարտադրում, և սխալների որ դասը չի տեսնում։
02 սեպտեմբերի, 2026 թ.
- Անկախ ապացույց, թե չէ՝ չի եղել. DeepSeek-ը հենց նոր իր scoreboard-ը դրսից լրացվող դարձրեց
DeepSeek-ը բացեց իր ագենտային harness-ը և անվանեց V4-Pro-ի ագենտային միավորների հետևում կանգնած ռեժիմը, effort-ը և sampling-ը։ Սովորականից լավ բացահայտում, և դեռ ոչ ապացույց. վենդորի թիվը մնում է vendor_disclosed, մինչև երկրորդ կողմը նույն կոնֆիգը չքշի և trace-երը չհրապարակի։
02 սեպտեմբերի, 2026 թ.
- Ագենտային կոդինգը prefill-ի խնդիր է, իսկ բոլորը դեկոդ են գնում
Հարցրեք՝ վայրկյանում քանի թոքեն է պետք լոկալ կոդինգ-ագենտին, և ամեն պատասխան դեկոդի արագություն կմեջբերի։ Բայց ագենտի քայլը հսկա պրոմպտ է ու կարճ պատասխան. սպասումն ապրում է prefill-ում, և երկաթի խոսակցությունն օպտիմալացնում է հարցումի սխալ կեսը։
01 սեպտեմբերի, 2026 թ.
- Agents-per-box. տարողության մետրիկան, որը ոչ ոք տուփի վրա չի տպում
Ագենտների երամի շուրջ խոսակցությունը սնվում է մեկ հոսքի դեկոդի թվերով, մինչդեռ հենց այդ մետրիկան դադարում է կարևոր լինել այն պահին, երբ երամ ես գործարկում։ Ինչ սովորեցինք ընդհանուր տուփեր չափաբերելիս, և ինչ հարց արժե, որ գնորդները տան վաճառողներին դրա փոխարեն։
01 սեպտեմբերի, 2026 թ.
- Այն ամենը, ինչ մեր harness-ը հրաժարվում է չափել. անվստահության changelog
Բենչմարք-harness-ին վստահում են ոչ թե չափածի, այլ մերժածի համար։ Մերը սկսվեց ութսուն տող միամիտ ցիկլից; այդուհետ ամեն տարբերակ սպի է՝ commit-հաղորդագրությամբ։ Անվավեր առաջին գործարկումը, որ պահեցինք, հարևանի ստուգումը, fallback-դետեկտորը, բառը, որ համընկավ ուրիշ բառի մեջ։
01 սեպտեմբերի, 2026 թ.
- Ամեն բենչմարկային թիվ քողարկված կոնֆիգ է
Երկու ազնիվ մարդ չափում են նույն մոդելը նույն երկաթի վրա և ստանում կտրուկ տարբեր թվեր։ Ոչ ոք չի ստել. հրապարակված արագությունը սեղմված կոնֆիգուրացիա է, և սեղմումը կորստաբեր է։ Ինչ պիտի կրի թիվը, որ արժենա մեջբերել, և ինչպես կարդալ մի թիվ, որը ոչինչ չի կրում։
20 օգոստոսի, 2026 թ.
- Դաշբորդը մեկ օրում ստեց երկու անգամ՝ հակառակ ուղղություններով
Մեկ տուփ, մեկ կեսօր. մոդել, որը HTTP 200-ի տակ դատարկ պատասխաններ է վերադարձնում, և երկու առողջ կոնտեյներ, որոնց սխալ պորտին ուղղված զոնդը unhealthy է հայտարարել։ «Կանաչ, բայց փչացած»-ը և «կարմիր, բայց առողջ»-ը նույն հիվանդությունն են, և դեղը նույնն է։
20 օգոստոսի, 2026 թ.
- Ես ամեն օր AI եմ օգտագործում։ Եվ համարում եմ, որ լուդդիտները ճիշտ էին
Մեկ տարվա մատյան՝ ամեն դեպք, երբ AI-ն ստել է, և ամեն դեպք, երբ լրջորեն օգնել է։ Ստուգման պրոտոկոլը, որին սա հանգեցրեց, և ինչու է լուդդիտների իրական պատմությունը որակի ու անցման գնի մասին, ոչ թե մեքենաների վախի։
14 օգոստոսի, 2026 թ.