開発
NVIDIAがDGX Spark 64GB発表——卓上で1ペタFLOPを実現するGrace Blackwell搭載AI開発機
2026/10/03
NVIDIAがDGX Spark 64GBを発表
NVIDIAは2026年10月2日、デスクトップAIシステム「DGX Spark」に新たな 64GB構成 を追加すると発表した。Acer、ASUS、Dell、Gigabyte、HP、MSIを通じて提供され、2026年10月23日にNVIDIA Marketplaceおよびリテールパートナー経由で発売される予定だ。既存の128GB構成も引き続き販売される。
主なスペック
64GB版もGrace Blackwellスーパーチップ「GB10」を搭載する。CPUは20コームArm(Cortex-X925×10+Cortex-A725×10)、AI演算性能はスパーシティありのFP4精度で最大 1ペタFLOP とされる。メモリは128GBモデルのLPDDR5xから64GBに変更されたが、CPUとGPUがNVLink-C2Cを介して同一プールを共有するコヒーレント統合メモリアーキテクチャは維持されている。メモリ帯域は273 GB/s。
| 項目 | 仕様 |
|---|---|
| スーパーチップ | NVIDIA GB10 Grace Blackwell |
| CPU | 20コアArm(X925×10+A725×10) |
| AI演算(FP4・スパーシティあり) | 最大1 PFLOP |
| メモリ | 64GB LPDDR5x(統合) |
| メモリ帯域 | 273 GB/s |
| ストレージ | 1/2/4TB NVMe M.2(自己暗号化) |
| ネットワーク | ConnectX-7 NIC(200GbE)、Wi-Fi 7、BT 5.3 |
| OS | NVIDIA DGX OS(Ubuntuベース) |
| サイズ/重量 | 150×150×50.5 mm/1.2 kg |
| 発売日 | 2026年10月23日 |
出典:NVIDIAスペック情報より
ソフトウェア面では、初回起動時からPyTorch、Jupyter、Ollamaを含むNVIDIA AIスタックが利用可能。NVIDIA NemoClawはコマンド1つでインストールでき、OpenClawエージェントにプライバシー・セキュリティ制御を追加する。また NVIDIA Agent Toolkit の一部であるOpenShellがポリシーベースのガードレールを提供するとされている。
本体は通常のコンセント(壁面コンセント)で動作し、サーバールームや特別な冷却設備を必要としない点も強調されている。
64GBで動くオープンモデル
NVIDIAは「今日の最も有能な30〜35Bクラスのオープンモデルには64GBで十分」と位置付けている。記事で言及されている主なモデルは以下の通り。
| モデル | 開発元 | 種別 | 想定フットプリント |
|---|---|---|---|
| Muse Glimmer | Meta | 29.6B dense(テキスト+画像) | 約17GB(量子化時) |
| Nemotron 3.5 Lightning | NVIDIA | 30B MoE(30B-A3B) | NVFP4チェックポイント |
| Qwen3.8-27B | Alibaba Qwen | 27B dense | 約13.5GB(4ビット) |
フットプリントは重みのみの推定値であり、KVキャッシュやランタイムオーバーヘッドは別途かかる
Metaの Muse Glimmer はローカルエージェント向けに設計されており、コンテキスト長は131Kトークン。MetaはSWE-Bench Proで51.2、MCP Atlasで75.5のスコアを報告しているとされる。なおBF16フルモデルは55GB超を必要とするため、64GBでの実用的な選択肢は量子化版(約17GB)になるとMarkTechPostは説明している。
DeepSeek V4 Flashのような大規模モデルは64GBの1台では動かず、NVIDIAは4台の64GB Sparkをクラスター化して動作させるベンチマークを実施しているという。
クラスタリングで拡張
ConnectX-7(200GbE)はすべてのDGX Sparkに標準搭載されており、クラスター構成はオプションではなく標準機能と位置付けられている。64GB×2台をQSFPケーブルで直接接続すると 128GBの統合メモリと最大2 PFLOP の演算性能が得られる。
NVIDIAは、64GB×2台のクラスターは128GBの単体DGX Sparkと比較して 最大1.7倍のパフォーマンス を発揮すると述べている。これは演算性能が倍増し、合計帯域が546 GB/sになるためとされる。
管理ツール NVIDIA Sync はWindows/macOSアプリとして提供され、ネットワーク上のSpark検出・SSH管理・最大4台のクラスター構成を担う。また、Tailscaleメッシュを利用して拠点をまたいだ接続も可能で、その場合もデータはクラウドを経由しないとされている。
クラスター規模の拡大に伴い、初回トークン出力時間(TTFT)はノード数の倍増ごとに約半分になり、ファインチューニングはほぼ線形にスケールするとNVIDIAは説明する。デコード速度の改善は4ノードで約1.4倍と控えめとされている。
主な用途と制約
MarkTechPostが紹介している代表的な用途は次の5つだ。
- 常時稼働のパーソナルエージェント——GitHubリポジトリやRSSフィードをツールとして連携し、一晩中タスクを処理
- 自社リポジトリでのコーディングモデルのファインチューニング——QLoRAで70Bモデルを64GBに収め、内部コードベースを学習させる(NVIDIAは単一ノードのnanochat分散ファインチューニングで約18,400トークン/秒を計測したと報告)
- 新着モデルの即日評価——Hugging Faceに公開された当日にOllamaやvLLMで取得し、APIコスト不要で何度でも評価を繰り返せる
- マルチモデルエージェントチーム——統合メモリを活かして複数モデルを同一プールで並走
- エッジ・ロボティクスのプロトタイピング——CUDAスタックで検証後にJetsonへデプロイ
一方、制約として「100ユーザーのチャットサーバーには向かない(273 GB/sの帯域が同時デコードスループットを制限する)」と明記されている。1台で扱えるモデルは最大100Bパラメータとされており、それ以上の場合はクラスターか128GB構成が推奨される。
エージェント時代のトークンコスト問題
NVIDIAが64GBモデルを投入した背景として、記事はエージェントのトークン消費量が2026年初頭から14倍に増加したという点を挙げている。ツール呼び出し、リトライ、長大なコンテキスト、マルチステップ計画がトークンを常時消費するため、クラウドAPIでは従量課金コストが膨らむ。ローカルハードウェアでは トークン単位の料金が発生しない という点が、DGX Sparkの差別化軸の一つとなっている。
本記事はNVIDIAの提供情報を含むMarkTechPostの記事をもとに作成しています。