Հարցրեք վեբին՝ արժե՞ գնել DGX Spark-ը լոկալ LLM աշխատանքի համար, — կստանաք
սպեկ-թերթիկներ. 128 GB unified, մեկ պետաֆլոպ նոսր FP4, ConnectX-7։ Այն, ինչ
գրեթե երբեք չեք ստանա, — թե տուփն իրականում ինչ արեց որևէ մեկի համար
իրական workload-ի տակ։ Մենք զույգ ունենք, հում գործարկումները հրապարակել
ենք, և այս էջը գնորդի հարցին պատասխանում է միայն չափվածով — բացահայտ նշված
սահմաններով, որովհետև մեր DGX գիծը bring-up աշխատանք է (lab_single_run),
ոչ թե մեր եռակի կրկնության մեթոդաբանությունը։
Ինչ իրականում արեց Spark-երի զույգը
Ստորև ամեն ինչ մեջբերվում է մեր հրապարակային գործարկումների ռեպոզիտորիաներից և վերարտադրելի է դրանցում եղած բաղադրատոմսերով։
Այն տանը սպասարկեց 284B պարամետրանոց MoE։ DeepSeek-V4-Flash-0731 (284B ընդհանուր, ~13B ակտիվ), tensor-parallel՝ երկու հանգույցի վրայով, 200G RoCE-ով
։ Միահոսք կլիենտային դեկոդը վերջնական կոնֆիգուրացիայի վրա.67.6 tok/s քարտանման կարճ ելքի պրոֆիլի վրա, 43.7 tok/s ծանր 4K-կոնտեքստանոց արձակ պրոֆիլի վրա ։ Այս պրոֆիլային ցրվածքը — ոչ թե սարքաշարը — գլխավոր պատճառն է, որ Spark-ի հրապարակված թվերը միմյանց հետ չեն համընկնում; ամբողջական հաշտեցումը՝ առանձին էջ։
Այն ագրեգատ հավաքեց խմբի համար։ 12 զուգահեռ հոսքի դեպքում նույն կոնֆիգուրացիան code պրոֆիլի վրա տվեց 260.4 tok/s ագրեգատ ; ավելի վաղ 1M-կոնտեքստանոց բիլդում 8 հոսքը պահում էր ~99 tok/s ագրեգատ, իսկ 12 հոսքը՝ 141–146 tok/s ։ Ագրեգատը սերվինգի թիվ է, ոչ թե զգացողության. բաժանեք ձեր զուգահեռության վրա, նախքան չաթ-սեսիա պատկերացնելը։
Այն անցավ կոնտեքստի կորով մինչև միլիոն թոքեն — և ճշմարտությունն ասաց դրա մասին։ Դեկոդը գնում էր 42.7 tok/s 16K խորության վրա, 17.6՝ 512K-ի վրա, 17.2՝ 1.03M-ի վրա — պլատո կես միլիոնի նշագծից հետո, ինչն իսկապես ուշագրավ է։ Հաշիվը գալիս է այլ տեղից. 1M-թոքենանոց կոնտեքստի առաջին լցումն արժեցավ 642 վայրկյան սառը վիճակում, 4 վայրկյան՝ տաք ։ Միլիոն թոքենանոց պատուհանը, որի լցումը կարող ես թույլ տալ քեզ մեկ անգամ, այլ պրոդուկտ է, քան այն, որի լցումը՝ ամեն հարցումին։
Մեկ դրոշակ ավելի կարևոր եղավ, քան ցանկացած թյունինգ։ Runtime-ը ներառում
է MoE միջուկ՝ հավաքված այս մոդելի MXFP4 փորձագետների համար, և բացառում է այն
ավտոընտրությունից. --moe-backend flashinfer_b12x-ը միահոսք դեկոդը կլիենտի
կողմից 59.7-ից հասցրեց 67.6 tok/s ՝ engine-ի կողմից չափված 9–12%
քայլերի հաճախության շահույթ ։ Backend-ի հաշվետվությունը
վերլուծում է դա; բաղադրատոմսի էջը
ցույց է տալիս, թե ինչպես ստուգել, որ դրոշակն իրոք գործել է։
Ում համար է զույգը
- Ուզում եք բաց MoE-ների ամենամեծ դասը ձեր սեփական տանիքի տակ։ Երկու Spark դա արեցին — բավական կայուն, որպեսզի գործարկումները հրապարակվեն։ Մեր պարկում ուրիշ ոչինչ այս հզորության ու սեղանային ոտնահետքի դեպքում դա չարեց։
- Սպասարկում եք փոքր խումբ, ոչ թե մեկ անհամբեր մարդու։ Ագրեգատային թվերն իրական են; առանձին հոսքի թվերը բարձր զուգահեռության դեպքում համեստ են։
- Զբաղվում եք long-context հետազոտությամբ։ Խորության պլատոն գտածո է, որի համար արժե սարքաշար ունենալ — եթե ձեր սեսիաները վերաօգտագործում են prefix-ը, և 642-վայրկյանանոց սառը prefill-ն ամորտիզացվում է։
Ում չարժե գնել
- Միայնակ, ուշացման նկատմամբ զգայուն աշխատանք ծանր prompt-երի վրա։ 43.7 tok/s ծանր պրոֆիլի վրա աշխատելի է, բայց ոչ առույգ, և ամեն թարմ երկար փաստաթուղթ prefill-ը վճարում է ամբողջությամբ։
- Նրանք, ովքեր տվյալների կենտրոնի Blackwell-ի վարք են սպասում։ Մեր ստենդի էջը սահմանը պարզ ասում է. GB10-ի արդյունքները դեպի վեր չեն ընդհանրացվում։
- Նրանք, ովքեր պատրաստ չեն այն շահագործել։ Bring-up-ն իրական աշխատանք
էր — մեկտողանոց պորտի բագն օրեր կերավ (սագան),
իսկ ստանդարտ GPU մոնիտորինգը կիսատ է աշխատում. GB10-ի unified memory-ի
վրա
dcgm-exporter-ը չի գործում, և NVML-ը հարցումների զգալի մասի վրա վերադարձնում է N/A; մենք ի վերջոnvidia-smi-ն պարսում ենք սեփական textfile collector-ի մեջ (վերլուծությունը՝ ռուսերեն)։
Այս պատասխանի սահմանները
Մեկ զույգ միավոր, կենտրոնում մեկ մոդելային ընտանիք, միանվագ անցումներ
warmup-ներով՝ մեր եռակի կրկնության կարգապահության փոխարեն — ապացույցի
մակարդակը lab_single_run է, և պիտակը նշանակում է հենց դա։ Գնային խորհուրդ
չկա. սարքաշարի գները շարժվում են, և այս լաբորատորիան դրանք չի հրապարակում։
Երբ մեր methodology-v1 գիծը հասնի Spark-երին, այս էջի թվերը կփոխարինվեն
claim-երով՝ վստահության միջակայքերով — բաժանորդագրվեք
/hy/subscribe/-ում, եթե ձեզ պետք է հենց այդ
իրադարձությունը, ոչ թե այս ակնթարթը։
Հում գործարկումները, մանիֆեստները և սերվինգի բաղադրատոմսը՝ botAGI/dspark-0731-gb10 և 1M-կոնտեքստի ռեպոզիտորիան։