Չափված պատասխաններ

Հարցեր լոկալ LLM-ների մասին՝ չափումներից ստացված պատասխաններով

Հարցերը, որոնք իրապես տալիս են, այն ձևակերպումներով, որոնցով տալիս են։ Այստեղ պատասխանը մեկ նախադասությամբ է; ամեն թիվ, շրջանակ և հում գործարկում մեկ սեղմման հեռավորության վրա են։ Չչափվածի մասին այդպես էլ գրված է։

Որքա՞ն արագ է զգացվում

Քանի՞ թոքեն վայրկյանում է բավարար լոկալ LLM-ի համար

«Բավարարը» բաժանվում է երեք չափելի փորձառության. սպասումը մինչև առաջին օգտակար բառը, հոսքը դրանից հետո և այն, թե ընդհանրապես կգա՞ պատասխան — մեկ կլոր թիվը դրանք չի տեղավորի։

Ապացույցները →

Ինչո՞ւ է մտածող մոդելն այդքան երկար լռում պատասխանից առաջ

Մտորումների հոսքը մեկնարկում է ակնթարթորեն, բայց ուղղված չէ ձեզ; առաջին տեսանելի բառը սպասում է դրա ավարտին։ Չափեք մինչև պատասխանի առաջին թոքենը, այլապես դաշբորդը լռությունն արագ կհամարի։

Ապացույցները →

Ինչո՞ւ է երկար փաստաթղթով սկսելն այդքան ավելի դանդաղ

Մոդելը կարդում է ամբողջ փաստաթուղթը՝ նախքան որևէ բան ասելը, և prefill-ի այդ հաշիվն աճում է երկարության հետ — չափված է նույն տուփի վրա երկու խորությամբ՝ մնացած ամեն ինչը սառեցրած։

Ապացույցները →

Ինչո՞ւ է նույն փաստաթղթի շուրջ երկրորդ հարցն ակնթարթային

Prompt cache-ը. բայթ առ բայթ նույնական պրեֆիքսը prefill-ը վճարում է մեկ անգամ։ Այն ամենը, ինչ վերաշարադրում է պրեֆիքսը — վերախառնված RAG-կտորները, թայմսթեմփ կրող system prompt-ը — լուռ ստիպում է, որ ամեն հարց նորից վճարի։

Ապացույցները →

Ի՞նչ է տեղավորվում և ի՞նչ է դա տալիս

Ի՞նչ մոդելներ կաշխատեն 128 ԳԲ unified հիշողությամբ

35B-MoE դասն աշխատում է վայրկյանից արագ առաջին բառով և հիշողության պաշարով; ֆրոնտիր 284B դասը մեկ տուփում չի տեղավորվում — պահանջվեց զույգ։ Չափված է, ոչ թե սպեկ-թերթիկով հաշված։

Ապացույցները →

Q4-ն ընդդեմ Q8-ի — որակի տարբերությունն իրո՞ք նկատելի է

Մեր gate-երին՝ ոչ, այս մոդելի և այս workload-ների վրա; իսկ Q8_0-ի գինը դեկոդի տեմպում իրական է ու մշտական։ Անհարմար եզրակացություն. «վերցրու ամենամեծ քվանտը» խորհուրդն արագությունը ծախսում է աննկատելիի վրա։

Ապացույցները →

Vulkan թե՞ ROCm Strix Halo-ի վրա — ո՞րն է ավելի արագ llama.cpp-ի համար

Մեր կոնֆիգուրացիայում Vulkan-ը դեկոդում էր ավելի արագ՝ բոլոր gate-երում նույնական ճշտությամբ — սխալ backend-ի ընտրությունն արժեր մոտավորապես նույնքան, որքան կշիռների ճշգրտության կրկնապատկումը։

Ապացույցները →

Լոկալ LLM-ները հորինո՞ւմ են պատասխաններ, որոնք փաստաթղթում չկան

Մենք դա չափում ենք անպատասխան կոնտրոլ հարցերով. մի ընտանիքը մերժեց բոլոր անհնար հարցերը, մյուսը երբեմն ձախողվում էր լռությամբ — ոչ հորինվածքով։ Երկու վարքն էլ անտեսանելի է, քանի դեռ չես թեստավորում։

Ապացույցները →

Կիսել տուփը և քշել ամբողջ օրը

Քանի՞ միաժամանակյա օգտատիրոջ կդիմանա մեկ լոկալ LLM տուփը

Մեկ, չորս և ութ միաժամանակյա չաթերի չափված սանդուղքը ցույց է տալիս սպասման ոչ գծային աճ՝ կայուն ավարտվածությամբ — չափը հաշվեք ձեր օգտատերերի հանդուրժած սպասումից։

Ապացույցները →

Մինի համակարգիչը կթուլանա՞՝ ամբողջ օրը LLM-ներ քշելիս

Երեք ժամ անընդհատ փակ ցիկլով բեռ երկու նույնական միավորի վրա. առաջին րոպեի տեմպը երրորդ ժամի տեմպն էր։ Կանխատեսված «պոռթկում, հետո մարում» սցենարն այդպես էլ չեկավ։

Ապացույցները →

Երբ լուռ է ձախողվում

Ինչո՞ւ է կլիենտը ցույց տալիս դատարկ պատասխան HTTP 200-ով

Reasoning-մոդելը կարող է ամբողջ թոքեն-բյուջեն ծախսել մտորումների վրա և ձեզ ուղղված ոչինչ չարտադրել — տրանսպորտը հաջողություն է հաղորդում, օգտատերը դատարկություն է ստանում։ Չափել ենք, թե որքան հաճախ։

Ապացույցները →

Անջատե՞լ thinking ռեժիմը

Չաթի և կառուցվածքային ավտոմատացման համար մեր տուփի վրա՝ այո. thinking-ն արժեր մեկ-երկու կարգ սպասում և ոչինչ չգնեց, որ gate-երը նկատեին։ Իսկապես բարդ reasoning-ի համար մեր workload-ները ձեր ապացույցը չեն։

Ապացույցները →

Կարո՞ղ է լոկալ LLM-ը հուսալիորեն վերադարձնել խիստ JSON

Հուսալիությունը, պարզվեց, մոդելի հատկություն է, ոչ թե կարգավորումների. քվանտը, backend-ը և reasoning ռեժիմը խնդիրների հաջողությունը չշարժեցին — մոդելի ընտանիքի փոփոխությունը շարժեց։

Ապացույցները →

Ո՞ր մոդելն է լռում սեղմ թոքեն-բյուջեի դեպքում

Դեմ առ դեմ նույն բյուջեով և կորպուսով. ավելի երկար մտորող մոդելը շատ ավելի հաճախ է սպառում տեղը ոչինչ չասած — և երկու ձախողումն էլ գալիս է որպես HTTP 200։

Ապացույցները →

Ո՞ր տուփը

Ի՞նչ երկաթ գնել լոկալ AI homelab-ի համար

Նախ՝ workload-ը. անհատական օգնական, փոքր թիմ, փաստաթղթերով աշխատանք և ֆրոնտիր դասը չորս տարբեր գնումներ են։ Պատասխանում ենք նրանով, ինչ մեր տուփերն իրապես ցույց տվեցին, և անվանում ենք չչափված ուղիները։

Ապացույցները →

Ինչո՞ւ է ROCm-ը տեսնում ընդամենը մի քանի ԳԲ 128 ԳԲ Strix Halo տուփի վրա

Linux-ի վրա մոդելներն ապրում են GTT-ում, ոչ թե BIOS-ի հատկացրած կտորում, և առաստաղը սահմանում է TTM միջուկի պարամետրը, ոչ թե firmware-ի ընտրացանկը։ Մեր նոդը հատկացրած կտորը պահում է նվազագույն և այնուամենայնիվ պահում է հարյուր գիգաբայթ կշիռներ։

Ապացույցները →

Strix Halo թե՞ DGX Spark լոկալ AI-ի համար

Տարբեր գործիքներ, որոնց շուկան համեմատում է ճակատով. չափված աշխատանքային ձի մոդելների այն դասի համար, որ իրապես քշում են, ընդդեմ ամենամեծ բաց MoE դասին տանող միակ սեղանային ուղու — զույգով և կարաններով։

Ապացույցները →

DGX Spark-ն արժե՞ լոկալ LLM աշխատանքի համար

Այն տանը սպասարկեց 284B MoE և անցավ կոնտեքստի կորը մինչև միլիոն թոքեն; դա նաև իրական օպերացիոն աշխատանք է կիսաշխատող ստանդարտ մոնիտորինգով։ Չափված պատասխանը նշում է՝ ով պիտի վերցնի, ով՝ ոչ։

Ապացույցները →

nvidia-smi-ն կոտրված է DGX Spark-ի վրա — ինչպե՞ս մոնիտորել

dcgm-exporter-ը GB10-ի վրա չի աշխատում, և NVML-ը N/A է պատասխանում շատ բանի, որի վրա ալերտ եք դնում; հուսալի ուղին nvidia-smi-ի տեքստը textfile կոլեկտորով վերլուծելն է՝ կոլեկտորի հնացման ալերտով։

Ապացույցները →

Թվեր, որոնց հետ կարելի է վիճել

Ինչպե՞ս բենչմարկել լոկալ LLM-ը, որ թվերին հավատան

Հարցրեք աշխատող սերվերին, թե ինչ է իրապես քշում, ամրագրեք ամեն ինչ բայթի մակարդակով, սառեցրեք workload-ը, հաշվեք ճիշտ թոքենները, ձախողումները պահեք հայտարարում, կրկնեք — և կոնֆիգը հրապարակեք թվի կողքին։

Ապացույցները →

Ինչո՞ւ իմ թվերը չեն համընկնում կարդացածս ակնարկների հետ

Որովհետև հրապարակված թիվը քողարկված կոնֆիգ է. չնշված workload-պրոֆիլներ, տարբերակների միջև տեղաշարժված դեֆոլտներ, չանվանված firmware։ Տարաձայնությունների մեծ մասը լուծվում է, երբ ամեն թիվ կապվում է իր կոնֆիգին։

Ապացույցները →

Հաճախ են հարցնում — դեռ չափված չէ

Որքա՞ն արագ է gpt-oss-120b-ը Strix Halo-ի վրա դեռ չափված չէ

Մեր կողմից դեռ չափված չէ։ Համայնքի թվերը խիստ տարբերվում են՝ առանց ամրագրված digest-ների; որակավորման գործարկումը պլանավորված է։ Մինչ այդ այս էջը ոչ մեկի թիվը չի մեջբերի։

Ապացույցները →

Իսկ Apple Silicon-ը — M-շարքն ընդդեմ այս տուփերի դեռ չափված չէ

Հայտարարված ուղի մեր ստենդում՝ զրո հրապարակված գործարկումներով — ուրեմն զրո claim-երով։ Երբ «MLX ընդդեմ llama.cpp-ի» բջիջը հասնի, այն կգա հում գործարկումներով։

Ապացույցները →

Ի՞նչ է լինում 8–24 ԳԲ VRAM-ի վրա, երբ մոդելը չի տեղավորվում դեռ չափված չէ

Ամենահաճախ տրվող և ամենաքիչ չափված հարցն այս դասից ցածր։ Offload-ուսումնասիրությունը հայտարարված ուղի է; ոչինչ հրապարակված չէ, ուրեմն ոչինչ չի պնդվում։

Ապացույցները →