# Լոկալ LLM-ները հորինո՞ւմ են պատասխաններ, երբ փաստաթուղթը դրանք չի պարունակում։ Չափեցինք

> Բոլորը հարցնում են՝ լոկալ մոդելը հորինո՞ւմ է իրենց փաստաթղթերի վրա; գրեթե ոչ ոք դա չի չափում։ Մեր workload-ում ներկառուցված է անպատասխան կոնտրոլ. հարցեր, որոնց փաստաթուղթը պատասխանել չի կարող, գնահատված ըստ այն բանի, թե մոդելը դա խոստովանո՞ւմ է։ Երկու ընտանիք, չիմանալու երկու ձև։

- Published: 2026-08-20
- Evidence level: lab_repeated
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/do-local-llms-invent-answers/

Կարճ, չափված պատասխանն այս տուփի և այս մոդելների համար. մի մոդելային
ընտանիքը գտավ այն, ինչ կար փաստաթղթում, և առանց բացառության խոստովանեց
այն, ինչ չկար։ Մյուսը գտավ գրեթե ամեն ինչ — իսկ երբ հարցը փաստաթղթում
պատասխան չուներ, երբեմն ձախողվում էր ոչ թե պատասխան հորինելով, այլ
ընդհանրապես ոչինչ չասելով։ Երկու վարքն էլ կարևոր է, և երկրորդն
անտեսանելի է, քանի դեռ դիտավորյալ հենց դրա համար չես չափում։

«Կհորինի՞ իմ փաստաթղթերի վրա» — առաջին հարցն է, որ տալիս է ցանկացած
մարդ՝ նախքան լոկալ մոդելին իրական ֆայլեր վստահելը, և դրան գրեթե միշտ
պատասխանում են զգացողություններով կամ լիդերբորդի միավորներով, որոնք
չափված են ուրիշների ամպերում։ Մեր երկար կոնտեքստի workload-ը հարցը
տալիս է ուղիղ, սպառողական սարքաշարի վրա, կոնտրոլ խմբով։

## Ինչ է թեստն իրականում

Պրոմպտի մեջ մտնում է փաստաթուղթ — 2k-ից 32k թոքեն, անգլերեն և ռուսերեն —
կոնկրետ որոնելի փաստով և դրան նման տեսք ունենալու համար ընտրված շեղող
նյութով։ Հետևում են երկու տեսակի հարցեր։ Needle-հարցերը փաստաթղթում
պատասխան ունեն, և gate-ը ստուգում է, որ մոդելը վերադարձրել է հենց այդ
փաստը։ Կոնտրոլ հարցերը բուն իմաստն են. դրանք հարցնում են մի բան, որ
փաստաթուղթը չի պարունակում, և gate-ը մոդելին անցկացնում է միայն, եթե այն
հենց այդպես էլ ասում է։ Կոնտրոլ հարցին վստահ արժեքով պատասխանելը այն
ձախողումն է, որից բոլորը վախենում են; gate-ը նաև պահանջում է, որ
պատասխանի ցանկացած կոդանման արժեք բառացիորեն մեջբերելի լինի աղբյուրից,
այնպես որ հորինվածը չի կարող անցնել որպես գրեթե ճիշտ։ Ձախողված
հարցումները մնում են հայտարարի մեջ։

## Գտա՞ն մոդելներն այն, ինչ կար

Qwen3.6-35B-A3B-ն needle-ը գտավ
**100.0 % of requests** ([strix.qwen36.longctx.c1.needle-success](https://agmind.ai/claims/strix.qwen36.longctx.c1.needle-success/)) հաջողությամբ
խորության ամբողջ սանդուղքի վրա։ gemma-4-26B-A4B-ն մոտ էր՝
**95.8 % of requests** ([strix.gemma4.longctx.c1.needle-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.needle-success/))։ Տասնյակ
հազարավոր թոքենների վրա որոնումն այս մոդելային դասի համար այս տուփի վրա
մեծ մասամբ լուծված խնդիր է — հենց դրա համար էլ հետաքրքիր արդյունքն
ապրում է կոնտրոլ խմբում։

## Խոստովանեցի՞ն այն, ինչ չկար

Qwen3.6-ը մերժեց ամեն անհնար հարց.
**100.0 % of requests** ([strix.qwen36.longctx.c1.control-success](https://agmind.ai/claims/strix.qwen36.longctx.c1.control-success/)) անպատասխան
կոնտրոլների վրա։ gemma-4-ն անցավ դրանց
**75.0 % of requests** ([strix.gemma4.longctx.c1.control-success](https://agmind.ai/claims/strix.gemma4.longctx.c1.control-success/))-ը — և
ձախողումները մեր սպասածը չէին։

## Ինչ տեսք ունեին ձախողումները

Ոչ հորինվածք։ Երբ gemma-4-ը ձախողում էր կոնտրոլ հարցը, գերիշխող
օրինաչափությունը դատարկ պատասխանն էր. մոդելի reasoning-անցումը
թոքեն-բյուջեն ծախսում էր մտորումների վրա և օգտատիրոջն ուղղված ոչինչ
չէր արտադրում։ HTTP 200, ոչ մի հորինված արժեք, ընդհանրապես ոչ մի
պատասխան։ Դա էապես այլ ռիսկ է, քան հալյուցինացիան — pipeline-ը ստի
փոխարեն ստանում է դատարկություն — և կապվում է խափանման ռեժիմի հետ, որը
չափում ենք առանձին.
[answerless-հարցումը](https://agmind.ai/hy/reports/answerless-http-200/)։ Մոդելը, որը
«այստեղ չկա» էժան ասել չի կարող, կարող է փոխարենը թանկ ոչինչ չասել։

## Սա նշանակո՞ւմ է, որ այս մոդելները երբեք չեն հորինում

Ոչ, և շրջանակը կարևոր է։ Կոնտրոլները սինթետիկ են. կոդի տեսք ունեցող
փաստեր կառուցված փաստաթղթերում — դիզայն, որը գնահատումը դարձնում է
մեխանիկական, իսկ հորինվածքը՝ հայտնաբերելի։ Հակառակորդային տիրույթներ,
երկիմաստ հարցեր, իրար հակասող աղբյուրներ — դրանցից ոչինչ այստեղ չի
զոնդավորվում, և այս workload-ի վրա մաքուր կոնտրոլ թերթիկը որևէ մոդելի
համար ընդհանուր անձեռնմխելիության վկայական չէ։ Այն, ինչ չափումը
հաստատում է, ավելի նեղ է և միևնույնն է օգտակար. այս ձևի փաստաթղթերի
վրա, այս խորություններում մեկ պատրաստի կոնֆիգուրացիա մերժեց ամեն անհնար
հարց, իսկ մյուսի ձախողումները լռություններ էին, ոչ հորինվածքներ։

## Ինչպես ինքներդ գործարկել այս ստուգումը

Workload-ի պայմանագիրը, կորպուսները և գնահատման gate-երը — ներառյալ
մերժման բառասահմանային մարկերները և հիմնավորվածության ստուգումը —
[հրապարակային harness-ում են](https://github.com/botAGI/agmind-bench)։
Ուղղեք այն ձեր սեփական սերվերին ու ձեր սեփական փաստաթղթերին; եթե ձեր
թվերը մերինի հետ չեն համընկնում,
[մենք ուզում ենք դրանք](https://github.com/botAGI/agmind-lab/issues/new)։

Վերևի ամեն թիվ ունի մշտական էջ՝ շրջանակով, սահմանափակումներով և հում
գործարկումներով. [claim-երի ռեեստրը](https://agmind.ai/hy/claims/)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
