TIP
← 記事

開発

NVIDIAがDGX Spark 64GB発表——卓上で1ペタFLOPを実現するGrace Blackwell搭載AI開発機

2026/10/03

NVIDIAがDGX Spark 64GBを発表

NVIDIAは2026年10月2日、デスクトップAIシステム「DGX Spark」に新たな 64GB構成 を追加すると発表した。Acer、ASUS、Dell、Gigabyte、HP、MSIを通じて提供され、2026年10月23日にNVIDIA Marketplaceおよびリテールパートナー経由で発売される予定だ。既存の128GB構成も引き続き販売される。

主なスペック

64GB版もGrace Blackwellスーパーチップ「GB10」を搭載する。CPUは20コームArm(Cortex-X925×10+Cortex-A725×10)、AI演算性能はスパーシティありのFP4精度で最大 1ペタFLOP とされる。メモリは128GBモデルのLPDDR5xから64GBに変更されたが、CPUとGPUがNVLink-C2Cを介して同一プールを共有するコヒーレント統合メモリアーキテクチャは維持されている。メモリ帯域は273 GB/s。

項目仕様
スーパーチップNVIDIA GB10 Grace Blackwell
CPU20コアArm(X925×10+A725×10)
AI演算(FP4・スパーシティあり)最大1 PFLOP
メモリ64GB LPDDR5x(統合)
メモリ帯域273 GB/s
ストレージ1/2/4TB NVMe M.2(自己暗号化)
ネットワークConnectX-7 NIC(200GbE)、Wi-Fi 7、BT 5.3
OSNVIDIA DGX OS(Ubuntuベース)
サイズ/重量150×150×50.5 mm/1.2 kg
発売日2026年10月23日

出典:NVIDIAスペック情報より

ソフトウェア面では、初回起動時からPyTorch、Jupyter、Ollamaを含むNVIDIA AIスタックが利用可能。NVIDIA NemoClawはコマンド1つでインストールでき、OpenClawエージェントにプライバシー・セキュリティ制御を追加する。また NVIDIA Agent Toolkit の一部であるOpenShellがポリシーベースのガードレールを提供するとされている。

本体は通常のコンセント(壁面コンセント)で動作し、サーバールームや特別な冷却設備を必要としない点も強調されている。

64GBで動くオープンモデル

NVIDIAは「今日の最も有能な30〜35Bクラスのオープンモデルには64GBで十分」と位置付けている。記事で言及されている主なモデルは以下の通り。

モデル開発元種別想定フットプリント
Muse GlimmerMeta29.6B dense(テキスト+画像)約17GB(量子化時)
Nemotron 3.5 LightningNVIDIA30B MoE(30B-A3B)NVFP4チェックポイント
Qwen3.8-27BAlibaba Qwen27B dense約13.5GB(4ビット)

フットプリントは重みのみの推定値であり、KVキャッシュやランタイムオーバーヘッドは別途かかる

Metaの Muse Glimmer はローカルエージェント向けに設計されており、コンテキスト長は131Kトークン。MetaはSWE-Bench Proで51.2、MCP Atlasで75.5のスコアを報告しているとされる。なおBF16フルモデルは55GB超を必要とするため、64GBでの実用的な選択肢は量子化版(約17GB)になるとMarkTechPostは説明している。

DeepSeek V4 Flashのような大規模モデルは64GBの1台では動かず、NVIDIAは4台の64GB Sparkをクラスター化して動作させるベンチマークを実施しているという。

クラスタリングで拡張

ConnectX-7(200GbE)はすべてのDGX Sparkに標準搭載されており、クラスター構成はオプションではなく標準機能と位置付けられている。64GB×2台をQSFPケーブルで直接接続すると 128GBの統合メモリと最大2 PFLOP の演算性能が得られる。

NVIDIAは、64GB×2台のクラスターは128GBの単体DGX Sparkと比較して 最大1.7倍のパフォーマンス を発揮すると述べている。これは演算性能が倍増し、合計帯域が546 GB/sになるためとされる。

管理ツール NVIDIA Sync はWindows/macOSアプリとして提供され、ネットワーク上のSpark検出・SSH管理・最大4台のクラスター構成を担う。また、Tailscaleメッシュを利用して拠点をまたいだ接続も可能で、その場合もデータはクラウドを経由しないとされている。

クラスター規模の拡大に伴い、初回トークン出力時間(TTFT)はノード数の倍増ごとに約半分になり、ファインチューニングはほぼ線形にスケールするとNVIDIAは説明する。デコード速度の改善は4ノードで約1.4倍と控えめとされている。

主な用途と制約

MarkTechPostが紹介している代表的な用途は次の5つだ。

  1. 常時稼働のパーソナルエージェント——GitHubリポジトリやRSSフィードをツールとして連携し、一晩中タスクを処理
  2. 自社リポジトリでのコーディングモデルのファインチューニング——QLoRAで70Bモデルを64GBに収め、内部コードベースを学習させる(NVIDIAは単一ノードのnanochat分散ファインチューニングで約18,400トークン/秒を計測したと報告)
  3. 新着モデルの即日評価——Hugging Faceに公開された当日にOllamaやvLLMで取得し、APIコスト不要で何度でも評価を繰り返せる
  4. マルチモデルエージェントチーム——統合メモリを活かして複数モデルを同一プールで並走
  5. エッジ・ロボティクスのプロトタイピング——CUDAスタックで検証後にJetsonへデプロイ

一方、制約として「100ユーザーのチャットサーバーには向かない(273 GB/sの帯域が同時デコードスループットを制限する)」と明記されている。1台で扱えるモデルは最大100Bパラメータとされており、それ以上の場合はクラスターか128GB構成が推奨される。

エージェント時代のトークンコスト問題

NVIDIAが64GBモデルを投入した背景として、記事はエージェントのトークン消費量が2026年初頭から14倍に増加したという点を挙げている。ツール呼び出し、リトライ、長大なコンテキスト、マルチステップ計画がトークンを常時消費するため、クラウドAPIでは従量課金コストが膨らむ。ローカルハードウェアでは トークン単位の料金が発生しない という点が、DGX Sparkの差別化軸の一つとなっている。


本記事はNVIDIAの提供情報を含むMarkTechPostの記事をもとに作成しています。


出典: NVIDIA Announces DGX Spark 64GB: A 1-PetaFLOP Grace Blackwell Desktop for Local AI Agents, Fine-Tuning, and Inference