Քանի՞ թոքեն վայրկյանում է բավարար լոկալ LLM-ի համար
«Բավարարը» բաժանվում է երեք չափելի փորձառության. սպասումը մինչև առաջին օգտակար բառը, հոսքը դրանից հետո և այն, թե ընդհանրապես կգա՞ պատասխան — մեկ կլոր թիվը դրանք չի տեղավորի։
Ապացույցները →Չափված պատասխաններ
Հարցերը, որոնք իրապես տալիս են, այն ձևակերպումներով, որոնցով տալիս են։ Այստեղ պատասխանը մեկ նախադասությամբ է; ամեն թիվ, շրջանակ և հում գործարկում մեկ սեղմման հեռավորության վրա են։ Չչափվածի մասին այդպես էլ գրված է։
«Բավարարը» բաժանվում է երեք չափելի փորձառության. սպասումը մինչև առաջին օգտակար բառը, հոսքը դրանից հետո և այն, թե ընդհանրապես կգա՞ պատասխան — մեկ կլոր թիվը դրանք չի տեղավորի։
Ապացույցները →Մտորումների հոսքը մեկնարկում է ակնթարթորեն, բայց ուղղված չէ ձեզ; առաջին տեսանելի բառը սպասում է դրա ավարտին։ Չափեք մինչև պատասխանի առաջին թոքենը, այլապես դաշբորդը լռությունն արագ կհամարի։
Ապացույցները →Մոդելը կարդում է ամբողջ փաստաթուղթը՝ նախքան որևէ բան ասելը, և prefill-ի այդ հաշիվն աճում է երկարության հետ — չափված է նույն տուփի վրա երկու խորությամբ՝ մնացած ամեն ինչը սառեցրած։
Ապացույցները →Prompt cache-ը. բայթ առ բայթ նույնական պրեֆիքսը prefill-ը վճարում է մեկ անգամ։ Այն ամենը, ինչ վերաշարադրում է պրեֆիքսը — վերախառնված RAG-կտորները, թայմսթեմփ կրող system prompt-ը — լուռ ստիպում է, որ ամեն հարց նորից վճարի։
Ապացույցները →35B-MoE դասն աշխատում է վայրկյանից արագ առաջին բառով և հիշողության պաշարով; ֆրոնտիր 284B դասը մեկ տուփում չի տեղավորվում — պահանջվեց զույգ։ Չափված է, ոչ թե սպեկ-թերթիկով հաշված։
Ապացույցները →Մեր gate-երին՝ ոչ, այս մոդելի և այս workload-ների վրա; իսկ Q8_0-ի գինը դեկոդի տեմպում իրական է ու մշտական։ Անհարմար եզրակացություն. «վերցրու ամենամեծ քվանտը» խորհուրդն արագությունը ծախսում է աննկատելիի վրա։
Ապացույցները →Մեր կոնֆիգուրացիայում Vulkan-ը դեկոդում էր ավելի արագ՝ բոլոր gate-երում նույնական ճշտությամբ — սխալ backend-ի ընտրությունն արժեր մոտավորապես նույնքան, որքան կշիռների ճշգրտության կրկնապատկումը։
Ապացույցները →Մենք դա չափում ենք անպատասխան կոնտրոլ հարցերով. մի ընտանիքը մերժեց բոլոր անհնար հարցերը, մյուսը երբեմն ձախողվում էր լռությամբ — ոչ հորինվածքով։ Երկու վարքն էլ անտեսանելի է, քանի դեռ չես թեստավորում։
Ապացույցները →Մեկ, չորս և ութ միաժամանակյա չաթերի չափված սանդուղքը ցույց է տալիս սպասման ոչ գծային աճ՝ կայուն ավարտվածությամբ — չափը հաշվեք ձեր օգտատերերի հանդուրժած սպասումից։
Ապացույցները →Երեք ժամ անընդհատ փակ ցիկլով բեռ երկու նույնական միավորի վրա. առաջին րոպեի տեմպը երրորդ ժամի տեմպն էր։ Կանխատեսված «պոռթկում, հետո մարում» սցենարն այդպես էլ չեկավ։
Ապացույցները →Reasoning-մոդելը կարող է ամբողջ թոքեն-բյուջեն ծախսել մտորումների վրա և ձեզ ուղղված ոչինչ չարտադրել — տրանսպորտը հաջողություն է հաղորդում, օգտատերը դատարկություն է ստանում։ Չափել ենք, թե որքան հաճախ։
Ապացույցները →Չաթի և կառուցվածքային ավտոմատացման համար մեր տուփի վրա՝ այո. thinking-ն արժեր մեկ-երկու կարգ սպասում և ոչինչ չգնեց, որ gate-երը նկատեին։ Իսկապես բարդ reasoning-ի համար մեր workload-ները ձեր ապացույցը չեն։
Ապացույցները →Հուսալիությունը, պարզվեց, մոդելի հատկություն է, ոչ թե կարգավորումների. քվանտը, backend-ը և reasoning ռեժիմը խնդիրների հաջողությունը չշարժեցին — մոդելի ընտանիքի փոփոխությունը շարժեց։
Ապացույցները →Դեմ առ դեմ նույն բյուջեով և կորպուսով. ավելի երկար մտորող մոդելը շատ ավելի հաճախ է սպառում տեղը ոչինչ չասած — և երկու ձախողումն էլ գալիս է որպես HTTP 200։
Ապացույցները →Նախ՝ workload-ը. անհատական օգնական, փոքր թիմ, փաստաթղթերով աշխատանք և ֆրոնտիր դասը չորս տարբեր գնումներ են։ Պատասխանում ենք նրանով, ինչ մեր տուփերն իրապես ցույց տվեցին, և անվանում ենք չչափված ուղիները։
Ապացույցները →Linux-ի վրա մոդելներն ապրում են GTT-ում, ոչ թե BIOS-ի հատկացրած կտորում, և առաստաղը սահմանում է TTM միջուկի պարամետրը, ոչ թե firmware-ի ընտրացանկը։ Մեր նոդը հատկացրած կտորը պահում է նվազագույն և այնուամենայնիվ պահում է հարյուր գիգաբայթ կշիռներ։
Ապացույցները →Տարբեր գործիքներ, որոնց շուկան համեմատում է ճակատով. չափված աշխատանքային ձի մոդելների այն դասի համար, որ իրապես քշում են, ընդդեմ ամենամեծ բաց MoE դասին տանող միակ սեղանային ուղու — զույգով և կարաններով։
Ապացույցները →Այն տանը սպասարկեց 284B MoE և անցավ կոնտեքստի կորը մինչև միլիոն թոքեն; դա նաև իրական օպերացիոն աշխատանք է կիսաշխատող ստանդարտ մոնիտորինգով։ Չափված պատասխանը նշում է՝ ով պիտի վերցնի, ով՝ ոչ։
Ապացույցները →dcgm-exporter-ը GB10-ի վրա չի աշխատում, և NVML-ը N/A է պատասխանում շատ բանի, որի վրա ալերտ եք դնում; հուսալի ուղին nvidia-smi-ի տեքստը textfile կոլեկտորով վերլուծելն է՝ կոլեկտորի հնացման ալերտով։
Ապացույցները →Հարցրեք աշխատող սերվերին, թե ինչ է իրապես քշում, ամրագրեք ամեն ինչ բայթի մակարդակով, սառեցրեք workload-ը, հաշվեք ճիշտ թոքենները, ձախողումները պահեք հայտարարում, կրկնեք — և կոնֆիգը հրապարակեք թվի կողքին։
Ապացույցները →Որովհետև հրապարակված թիվը քողարկված կոնֆիգ է. չնշված workload-պրոֆիլներ, տարբերակների միջև տեղաշարժված դեֆոլտներ, չանվանված firmware։ Տարաձայնությունների մեծ մասը լուծվում է, երբ ամեն թիվ կապվում է իր կոնֆիգին։
Ապացույցները →Մեր կողմից դեռ չափված չէ։ Համայնքի թվերը խիստ տարբերվում են՝ առանց ամրագրված digest-ների; որակավորման գործարկումը պլանավորված է։ Մինչ այդ այս էջը ոչ մեկի թիվը չի մեջբերի։
Ապացույցները →Հայտարարված ուղի մեր ստենդում՝ զրո հրապարակված գործարկումներով — ուրեմն զրո claim-երով։ Երբ «MLX ընդդեմ llama.cpp-ի» բջիջը հասնի, այն կգա հում գործարկումներով։
Ապացույցները →Ամենահաճախ տրվող և ամենաքիչ չափված հարցն այս դասից ցածր։ Offload-ուսումնասիրությունը հայտարարված ուղի է; ոչինչ հրապարակված չէ, ուրեմն ոչինչ չի պնդվում։
Ապացույցները →