# Արժե՞ արդյոք DGX Spark-ը լոկալ LLM աշխատանքի համար. չափված պատասխան

> Նիշայի ամենահաճախ տրվող գնորդական հարցին պատասխանում են գրեթե բացառապես սպեկ-թերթիկների թվաբանությամբ։ Ահա ինչ իրականում արեց GB10 հանգույցների զույգը մեր լաբորատորիայում — 284B MoE-ի սերվինգ, կոնտեքստի կոր մինչև միլիոն թոքեն — և ում արժե գնել այն, ում՝ ոչ։

- Published: 2026-08-16
- Evidence level: lab_single_run
- Funding: Սեփական ֆինանսավորում, ներքին հետազոտություն
- Canonical: https://agmind.ai/hy/reports/dgx-spark-worth-it/

Հարցրեք վեբին՝ արժե՞ գնել DGX Spark-ը լոկալ LLM աշխատանքի համար, — կստանաք
սպեկ-թերթիկներ. 128 GB unified, մեկ պետաֆլոպ նոսր FP4, ConnectX-7։ Այն, ինչ
գրեթե երբեք չեք ստանա, — թե տուփն իրականում ինչ *արեց* որևէ մեկի համար
իրական workload-ի տակ։ Մենք զույգ ունենք, հում գործարկումները հրապարակել
ենք, և այս էջը գնորդի հարցին պատասխանում է միայն չափվածով — բացահայտ նշված
սահմաններով, որովհետև մեր DGX գիծը bring-up աշխատանք է (`lab_single_run`),
ոչ թե մեր եռակի կրկնության մեթոդաբանությունը։

## Ինչ իրականում արեց Spark-երի զույգը

Ստորև ամեն ինչ մեջբերվում է մեր հրապարակային գործարկումների
ռեպոզիտորիաներից և վերարտադրելի է դրանցում եղած բաղադրատոմսերով։

**Այն տանը սպասարկեց 284B պարամետրանոց MoE։** DeepSeek-V4-Flash-0731 (284B
ընդհանուր, ~13B ակտիվ), tensor-parallel՝ երկու հանգույցի վրայով, 200G RoCE-ով
։ Միահոսք կլիենտային դեկոդը վերջնական կոնֆիգուրացիայի վրա.
67.6 tok/s քարտանման կարճ ելքի պրոֆիլի վրա, 43.7 tok/s ծանր
4K-կոնտեքստանոց արձակ պրոֆիլի վրա ։ Այս պրոֆիլային ցրվածքը — ոչ թե
սարքաշարը — գլխավոր պատճառն է, որ Spark-ի հրապարակված թվերը միմյանց հետ չեն
համընկնում; ամբողջական հաշտեցումը՝ [առանձին էջ](https://agmind.ai/hy/reports/dspark-speed-numbers-disagree/)։

**Այն ագրեգատ հավաքեց խմբի համար։** 12 զուգահեռ հոսքի դեպքում նույն
կոնֆիգուրացիան code պրոֆիլի վրա տվեց 260.4 tok/s ագրեգատ ;
ավելի վաղ 1M-կոնտեքստանոց բիլդում 8 հոսքը պահում էր ~99 tok/s
ագրեգատ, իսկ 12 հոսքը՝ 141–146 tok/s ։ Ագրեգատը սերվինգի թիվ է,
ոչ թե զգացողության. բաժանեք ձեր զուգահեռության վրա, նախքան չաթ-սեսիա
պատկերացնելը։

**Այն անցավ կոնտեքստի կորով մինչև միլիոն թոքեն — և ճշմարտությունն ասաց դրա
մասին։** Դեկոդը գնում էր 42.7 tok/s 16K խորության վրա, 17.6՝ 512K-ի վրա, 17.2՝ 1.03M-ի վրա
— պլատո կես միլիոնի նշագծից հետո, ինչն իսկապես ուշագրավ է։ Հաշիվը գալիս է
այլ տեղից. 1M-թոքենանոց կոնտեքստի *առաջին* լցումն արժեցավ 642 վայրկյան
սառը վիճակում, 4 վայրկյան՝ տաք ։ Միլիոն թոքենանոց պատուհանը, որի
լցումը կարող ես թույլ տալ քեզ մեկ անգամ, այլ պրոդուկտ է, քան այն, որի
լցումը՝ ամեն հարցումին։

**Մեկ դրոշակ ավելի կարևոր եղավ, քան ցանկացած թյունինգ։** Runtime-ը ներառում
է MoE միջուկ՝ հավաքված այս մոդելի MXFP4 փորձագետների համար, և բացառում է այն
ավտոընտրությունից. `--moe-backend flashinfer_b12x`-ը միահոսք դեկոդը կլիենտի
կողմից 59.7-ից հասցրեց 67.6 tok/s ՝ engine-ի կողմից չափված 9–12%
քայլերի հաճախության շահույթ ։ [Backend-ի հաշվետվությունը](https://agmind.ai/hy/reports/dsv4-flash-moe-backend-dgx-spark/)
վերլուծում է դա; [բաղադրատոմսի էջը](https://agmind.ai/hy/reports/deepseek-v4-flash-0731-dgx-spark-recipe/)
ցույց է տալիս, թե ինչպես ստուգել, որ դրոշակն իրոք գործել է։

## Ում համար է զույգը

- **Ուզում եք բաց MoE-ների ամենամեծ դասը ձեր սեփական տանիքի տակ։** Երկու
  Spark դա արեցին — բավական կայուն, որպեսզի գործարկումները հրապարակվեն։
  Մեր պարկում ուրիշ ոչինչ այս հզորության ու սեղանային ոտնահետքի դեպքում
  դա չարեց։
- **Սպասարկում եք փոքր խումբ, ոչ թե մեկ անհամբեր մարդու։** Ագրեգատային
  թվերն իրական են; առանձին հոսքի թվերը բարձր զուգահեռության դեպքում
  համեստ են։
- **Զբաղվում եք long-context հետազոտությամբ։** Խորության պլատոն գտածո է,
  որի համար արժե սարքաշար ունենալ — եթե ձեր սեսիաները վերաօգտագործում են
  prefix-ը, և 642-վայրկյանանոց  սառը prefill-ն ամորտիզացվում է։

## Ում չարժե գնել

- **Միայնակ, ուշացման նկատմամբ զգայուն աշխատանք ծանր prompt-երի վրա։**
  43.7 tok/s  ծանր պրոֆիլի վրա աշխատելի է, բայց ոչ առույգ, և ամեն
  թարմ երկար փաստաթուղթ prefill-ը վճարում է ամբողջությամբ։
- **Նրանք, ովքեր տվյալների կենտրոնի Blackwell-ի վարք են սպասում։** Մեր
  [ստենդի էջը](https://agmind.ai/hy/testbed/) սահմանը պարզ ասում է. GB10-ի արդյունքները դեպի
  վեր չեն ընդհանրացվում։
- **Նրանք, ովքեր պատրաստ չեն այն շահագործել։** Bring-up-ն իրական աշխատանք
  էր — մեկտողանոց պորտի բագն օրեր կերավ ([սագան](https://agmind.ai/hy/reports/dspark-speculative-1m-dgx-spark/)),
  իսկ ստանդարտ GPU մոնիտորինգը կիսատ է աշխատում. GB10-ի unified memory-ի
  վրա `dcgm-exporter`-ը չի գործում, և NVML-ը հարցումների զգալի մասի վրա
  վերադարձնում է N/A; մենք ի վերջո `nvidia-smi`-ն պարսում ենք սեփական
  textfile collector-ի մեջ ([վերլուծությունը՝ ռուսերեն](https://habr.com/ru/articles/1030802/))։

## Այս պատասխանի սահմանները

Մեկ զույգ միավոր, կենտրոնում մեկ մոդելային ընտանիք, միանվագ անցումներ
warmup-ներով՝ մեր եռակի կրկնության կարգապահության փոխարեն — ապացույցի
մակարդակը `lab_single_run` է, և պիտակը նշանակում է հենց դա։ Գնային խորհուրդ
չկա. սարքաշարի գները շարժվում են, և այս լաբորատորիան դրանք չի հրապարակում։
Երբ մեր methodology-v1 գիծը հասնի Spark-երին, այս էջի թվերը կփոխարինվեն
claim-երով՝ վստահության միջակայքերով — բաժանորդագրվեք
[/hy/subscribe/](https://agmind.ai/hy/subscribe/)-ում, եթե ձեզ պետք է հենց այդ
իրադարձությունը, ոչ թե այս ակնթարթը։

Հում գործարկումները, մանիֆեստները և սերվինգի բաղադրատոմսը՝
[botAGI/dspark-0731-gb10](https://github.com/botAGI/dspark-0731-gb10) և
[1M-կոնտեքստի ռեպոզիտորիան](https://github.com/botAGI/DeepSeek-V4-Flash-DSpark-GB10-2x-DGX-Spark-1m-fp4-fp8)։

---

Machine-readable claim registry: https://agmind.ai/claims.json · llms.txt: https://agmind.ai/llms.txt
