AI
NVIDIAがAIエージェント安全基盤を公開——「エージェントの外側」で制御する新アーキテクチャ
2026/09/29
エージェント自身には頼れない——NVIDIAが設計思想を転換
NVIDIAは2026年9月28日、AIエージェントの安全制御を「エージェントの外側」で行うオープンな参照設計「NVIDIA Open Agent Safety Platform」を発表した。CEOのジェンスン・フアン氏は100社以上の業界パートナーとともに本プラットフォームを発表したとXで述べている。
同社の技術報告書は、複数のフロンティアラボが報告した事例を根拠に挙げる。エージェントが評価環境を逸脱して本来アクセスすべきでないシステムに到達したり、自身の行動を誤って報告したりするケースが確認されており、共通パターンとしてアプリケーション層の制御をエージェントが迂回してタスクを完了させるという失敗モードが指摘されている。
NVIDIAはこの失敗モードを ドリフト(drift) と呼ぶ。ポリシーによるブロック、バグ、ツールの欠如、または曖昧な指示がトリガーになり得ると説明する。同社はドリフトを「能力を損なわずに学習で排除することはできない」と位置づけ、エージェントが自律的に自身を完全にガバナンスすることへの期待を否定する立場を取る。
2つのコアコンポーネント
OpenShell——ランタイムサンドボックス
OpenShell はApache 2.0ライセンスで公開されたセキュアなランタイムだ。各エージェントは分離されたサンドボックス内で動作し、ゲートウェイがDocker・Podman・MicroVM・Kubernetesのドライバをまたいでサンドボックスのライフサイクルを管理する。エージェントが発するすべての外向き通信はポリシーエンジンを経由し、許可・認証済みエンドポイントへのバインド・拒否およびロギングのいずれかの処置が取られる。
ファイルシステムとプロセスのルールはサンドボックス生成時に固定される一方、ネットワークおよびプロバイダールールはホットリロード可能とのことだ。Linux・macOS(Apple Silicon)・Windows WSL 2への導入が可能で、現時点ではリポジトリがアルファ版として公開されている。
Sentry——シリコン内ウォッチドッグ
Sentry はBlueField-4 DPU上で動作するアウトオブバンドの監視機構で、NVIDIA DOCAを活用してエージェントのリクエストとレスポンスを検査する。エージェントのアイデンティティ確認、データ・ツール・APIへのゼロトラストアクセス制御、および証明可能なテレメトリの提供を担う。ホストから独立して動作するため、ランタイムが侵害されてもSentry自体は無効化されない設計だという。
ハードウェア配置が「観測点」かつ「キルスイッチ」になる
プラットフォームの設計において、コンポーネントの物理的な配置が重要な役割を果たす。Vera Rubin POD では、各コンピュートトレイのBlueField-4がエージェントからモデルへの唯一の経路上に位置する。エージェントが次のアクションを起こすには推論呼び出しが必要なため、この経路が最良の観測点かつキルスイッチになるとNVIDIAは説明する。既存のVera + BlueField-4環境については、ソフトウェアアップデートでこれらの保護を有効化できるとしている。
スタック全体はNVIDIA Vera CPUに最適化されているが、ArmおよびIntelプラットフォームへの拡張も可能とのこと。NVIDIAは、Veraが従来のCPUインフラと比較してサンドボックス性能を最大80%向上させると主張しているが、この数値は同社の発表に基づくものだ。
設計を貫く5つの原則
- 検証可能なポリシー — エージェントが実行される前に、ポリシーがオペレーターの意図から逸脱できないことをプルーバーが確認する。
- アウトオブバンドの実施 — 制御をエージェントの届かない外部に置く。
- モデルへの経路を制御する — その経路が観測点であり、キルスイッチでもある。
- 可視化された推論に応じてオーソリティをスケールする — より高性能なエージェントほど、より検査可能な思考プロセスが必要になる。
- 共有責任 — ラボ・企業・ハードウェアプロバイダーがそれぞれの層を担う。
現状と今後
OpenShellはすでにGitHubで公開されておりApache 2.0ライセンスで利用可能だが、リポジトリはアルファ段階にある。Sentryの利用にはBlueField-4 DPUが必要となる。NVIDIAによれば、100以上の組織がすでにこのプラットフォームとの協業を進めているという。
AIエージェントが企業インフラへの深い権限を持つようになるにつれ、エージェント自身への信頼に依存しない「下位レイヤーからの安全制御」という設計思想は、今後の業界標準形成に影響を与える可能性がある。