Ապացույցներ

Ապացույցներ և տվյալներ

Յուրաքանչյուր հրապարակային արդյունք բաժանվում է ստուգելի արտեֆակտների՝ գրառում claim registry-ում, դրա հետևում կանգնած գործարկումներ և ներբեռնվող evidence bundle։

Claim registry

Կայքի ոչ մի առանցքային թիվ ձեռքով չի հավաքվում։ Յուրաքանչյուրը գեներացվում է ռեեստրի գրառումից, որը հղվում է այն run ID-ներին, որոնցից ստացվել է, օգտագործված ագրեգացիային, ճշգրիտ scope-ին (համակարգ, runtime, մոդելի արտեֆակտ, workload-ի ռևիզիա), որի համար թիվը ճիշտ է, և այն նեղացնող սահմանափակումներին։ Հետ կանչված (retracted) գրառումն ընդհանրապես չի կարող ռենդերվել — build-ը ձախողվում է։

Փոխարինված և հետ կանչված գրառումները մնում են ռեեստրում իրենց կարգավիճակով; ուղղումները արձանագրվում են errata էջում։

Evidence bundles

Հրապարակված որակավորման արդյունքն ուղեկցվում է փաթեթով, որը պարունակում է.

Անվավեր և ձախողված գործարկումները պահպանվում են նշումով, ոչ թե ջնջվում — կրկնական գործարկումը ստանում է նոր run ID, բնօրինակը մնում է գրառման մեջ։

Գործիքը բաց է

Harness-ը, որն արտադրում է այս փաթեթները, — կլիենտային վայրկյանաչափ, որը տարանջատում է ժամանակը մինչև առաջին թոքենը և ժամանակը մինչև պատասխանի առաջին թոքենը, դատարկ պատասխանների հաշվառումը որպես ձախողում, quality gate-եր, արտեֆակտների ստուգում հեշերով և SQL, որով դուրս է բերվում յուրաքանչյուր հրապարակվող թիվ, — բաց է. github.com/botAGI/agmind-bench։ Գործարկեք նույն բջիջը նույն կոնֆիգուրացիայի վրա և ստուգեք մեր թվերը; չվերարտադրվելը լիարժեք արդյունք է։

Խմբագրում մասնավոր նախագծերի համար

Մասնավոր փաթեթներն անցնում են դետերմինիստական խմբագրման կոնվեյերով՝ նախքան որևէ հրապարակային ածանցյալի հայտնվելը. զգայուն արժեքները հեռացվում են, կատարվում է գաղտնիքների սկան, ապա ձեռքով ստուգում, և հրապարակային ածանցյալը ստանում է սեփական ստուգիչ գումարը։ Թե կոնկրետ ինչ է խմբագրված՝ հայտարարվում է; խմբագրումն ինքը գրառման մասն է։

Ապացույցների մակարդակներ

ՄակարդակՆշանակություն
legacyՀավաքված մինչև v1 մեթոդաբանությունը; պահվում է պատմության համար, երբեք չի օգտագործվում ընթացիկ պնդումների համար։
lab_single_runՄեկ վալիդ գործարկում լաբորատորիայում։ Ամենաթույլ մակարդակը; մակնշվում է բացահայտ։
lab_repeatedԿրկնված վալիդ գործարկումներ մեկ յունիթի վրա; headline թվերը պահանջում են առնվազն սա։
lab_unit_replicatedՎերարտադրված երկրորդ՝ կոմերցիոն առումով նույնական յունիթի վրա։
external_reproducedՎերարտադրված լաբորատորիայից դուրս օպերատորի կողմից՝ հրապարակված բաղադրատոմսով։
vendor_disclosedԱրտադրողի թիվ՝ ներկայացված որպես այդպիսին — երբեք չի խառնվում լաբորատորիայի չափումների հետ։
estimatedԱծանցյալ կամ մոդելային գնահատական՝ բացահայտ մակնշումով; երբեք headline չէ։

Ինչ են ապացուցում և ինչ չեն ապացուցում ստուգիչ գումարները

Ստուգիչ գումարներն ապացուցում են, որ փաթեթը հրապարակումից հետո չի փոխվել։ Դրանք չեն ապացուցում, որ օպերատորը թեստն անցկացրել է ազնվորեն — ոչ մի հեշ դա անել չի կարող։ Հենց դրա համար գոյություն ունեն ապացույցների մակարդակները և արտաքին վերարտադրումը. լաբորատորիայի ամենաուժեղ պնդումն այն է, որն ուրիշն է վերարտադրել բաղադրատոմսով։

Հասանելիություն

Արխիվը բաց է. github.com/botAGI/agmind-lab պարունակում է հրապարակված փորձարկված կոնֆիգուրացիաների հետևում կանգնած յուրաքանչյուր evidence փաթեթ — ներառյալ պատճառներով պահպանված անվավեր գործարկումները — ամբողջական claim ռեեստրի և SQL-ի հետ միասին, որով դուրս է բերվում յուրաքանչյուր թիվ։ CC BY 4.0։