Հաշվետվություն

Արժե՞ արդյոք DGX Spark-ը լոկալ LLM աշխատանքի համար. չափված պատասխան

Նիշայի ամենահաճախ տրվող գնորդական հարցին պատասխանում են գրեթե բացառապես սպեկ-թերթիկների թվաբանությամբ։ Ահա ինչ իրականում արեց GB10 հանգույցների զույգը մեր լաբորատորիայում — 284B MoE-ի սերվինգ, կոնտեքստի կոր մինչև միլիոն թոքեն — և ում արժե գնել այն, ում՝ ոչ։

lab_single_run internal research 16 օգոստոսի, 2026 թ. · Ֆինանսավորում: Սեփական ֆինանսավորում, ներքին հետազոտություն

Հարցրեք վեբին՝ արժե՞ գնել DGX Spark-ը լոկալ LLM աշխատանքի համար, — կստանաք սպեկ-թերթիկներ. 128 GB unified, մեկ պետաֆլոպ նոսր FP4, ConnectX-7։ Այն, ինչ գրեթե երբեք չեք ստանա, — թե տուփն իրականում ինչ արեց որևէ մեկի համար իրական workload-ի տակ։ Մենք զույգ ունենք, հում գործարկումները հրապարակել ենք, և այս էջը գնորդի հարցին պատասխանում է միայն չափվածով — բացահայտ նշված սահմաններով, որովհետև մեր DGX գիծը bring-up աշխատանք է (lab_single_run), ոչ թե մեր եռակի կրկնության մեթոդաբանությունը։

Ինչ իրականում արեց Spark-երի զույգը

Ստորև ամեն ինչ մեջբերվում է մեր հրապարակային գործարկումների ռեպոզիտորիաներից և վերարտադրելի է դրանցում եղած բաղադրատոմսերով։

Այն տանը սպասարկեց 284B պարամետրանոց MoE։ DeepSeek-V4-Flash-0731 (284B ընդհանուր, ~13B ակտիվ), tensor-parallel՝ երկու հանգույցի վրայով, 200G RoCE-ով

։ Միահոսք կլիենտային դեկոդը վերջնական կոնֆիգուրացիայի վրա.

67.6 tok/s քարտանման կարճ ելքի պրոֆիլի վրա, 43.7 tok/s ծանր 4K-կոնտեքստանոց արձակ պրոֆիլի վրա ։ Այս պրոֆիլային ցրվածքը — ոչ թե սարքաշարը — գլխավոր պատճառն է, որ Spark-ի հրապարակված թվերը միմյանց հետ չեն համընկնում; ամբողջական հաշտեցումը՝ առանձին էջ։

Այն ագրեգատ հավաքեց խմբի համար։ 12 զուգահեռ հոսքի դեպքում նույն կոնֆիգուրացիան code պրոֆիլի վրա տվեց 260.4 tok/s ագրեգատ ; ավելի վաղ 1M-կոնտեքստանոց բիլդում 8 հոսքը պահում էր ~99 tok/s ագրեգատ, իսկ 12 հոսքը՝ 141–146 tok/s ։ Ագրեգատը սերվինգի թիվ է, ոչ թե զգացողության. բաժանեք ձեր զուգահեռության վրա, նախքան չաթ-սեսիա պատկերացնելը։

Այն անցավ կոնտեքստի կորով մինչև միլիոն թոքեն — և ճշմարտությունն ասաց դրա մասին։ Դեկոդը գնում էր 42.7 tok/s 16K խորության վրա, 17.6՝ 512K-ի վրա, 17.2՝ 1.03M-ի վրա — պլատո կես միլիոնի նշագծից հետո, ինչն իսկապես ուշագրավ է։ Հաշիվը գալիս է այլ տեղից. 1M-թոքենանոց կոնտեքստի առաջին լցումն արժեցավ 642 վայրկյան սառը վիճակում, 4 վայրկյան՝ տաք ։ Միլիոն թոքենանոց պատուհանը, որի լցումը կարող ես թույլ տալ քեզ մեկ անգամ, այլ պրոդուկտ է, քան այն, որի լցումը՝ ամեն հարցումին։

Մեկ դրոշակ ավելի կարևոր եղավ, քան ցանկացած թյունինգ։ Runtime-ը ներառում է MoE միջուկ՝ հավաքված այս մոդելի MXFP4 փորձագետների համար, և բացառում է այն ավտոընտրությունից. --moe-backend flashinfer_b12x-ը միահոսք դեկոդը կլիենտի կողմից 59.7-ից հասցրեց 67.6 tok/s ՝ engine-ի կողմից չափված 9–12% քայլերի հաճախության շահույթ ։ Backend-ի հաշվետվությունը վերլուծում է դա; բաղադրատոմսի էջը ցույց է տալիս, թե ինչպես ստուգել, որ դրոշակն իրոք գործել է։

Ում համար է զույգը

Ում չարժե գնել

Այս պատասխանի սահմանները

Մեկ զույգ միավոր, կենտրոնում մեկ մոդելային ընտանիք, միանվագ անցումներ warmup-ներով՝ մեր եռակի կրկնության կարգապահության փոխարեն — ապացույցի մակարդակը lab_single_run է, և պիտակը նշանակում է հենց դա։ Գնային խորհուրդ չկա. սարքաշարի գները շարժվում են, և այս լաբորատորիան դրանք չի հրապարակում։ Երբ մեր methodology-v1 գիծը հասնի Spark-երին, այս էջի թվերը կփոխարինվեն claim-երով՝ վստահության միջակայքերով — բաժանորդագրվեք /hy/subscribe/-ում, եթե ձեզ պետք է հենց այդ իրադարձությունը, ոչ թե այս ակնթարթը։

Հում գործարկումները, մանիֆեստները և սերվինգի բաղադրատոմսը՝ botAGI/dspark-0731-gb10 և 1M-կոնտեքստի ռեպոզիտորիան։

Ինչպես մեջբերել

AGmind Systems Lab (2026-08-16). Արժե՞ արդյոք DGX Spark-ը լոկալ LLM աշխատանքի համար. չափված պատասխան. Evidence level: lab_single_run. https://agmind.ai/hy/reports/dgx-spark-worth-it/
← Հաշվետվություններ