AI
Google DeepMind、Gemini 4シリーズ第1弾「Argon」を発表――最大100万出力トークンでコーディング・法務・サイバー防衛に照準
2026/10/02
Gemini 4 Argon とは
Google DeepMindは2026年9月30日、新世代フロンティアモデル「Gemini 4 Argon」を発表した。Gemini 4シリーズの第1弾に位置づけられ、長期的なソフトウェアエンジニアリング、法務・金融などエンタープライズ向け知識業務、そしてサイバーセキュリティ防衛を主なターゲットとしている。
最大の技術的変化:出力トークン数が64Kから100万へ
従来のGeminiモデルが1レスポンスあたり最大64Kトークンだったのに対し、Argonは最大100万トークンを1つのレスポンスで生成できると報告されている。MarkTechPostの記事によれば、Claude Opus 5.5・Claude Fable 5.1・GPT-6 Astraはいずれも128Kトークンが上限であり、Argonはその約8倍の生成能力を持つことになる。
Googleチームは「Argonは1つのトラジェクトリの中で深く思考し、数十万トークンを生成できる」と説明しており、大規模なコードリファクタリングや長大なレポート作成を、複数ターンに分割せず一度に処理できる点が開発者にとっての主な利点として挙げられている。ただし、入力コンテキストウィンドウのサイズはGoogleからまだ開示されていない。
価格体系
導入時の価格として、入力トークンが100万トークンあたり2ドル、出力トークンが同10ドルと公開されている。キャッシュ済み入力トークンには95%割引が適用され、100万トークンあたり0.10ドルとなる。導入期間終了後は入力4ドル・出力20ドルへ移行する予定だ。ちなみに100万出力トークンを使い切る場合、導入期間中は10ドル、通常期は20ドルのコストがかかることになる。
Artificial Analysisは「Argonは割引価格を用いた場合、タスクあたりのコストがGPT-6 Astraの60%で同等のインテリジェンス指数を達成している」と報告している。
ベンチマーク:18項目中13項目で首位
GoogleはArgonをGPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1と比較した。18項目中12項目で単独首位、1項目で同率首位という結果が報告されている。
Argonが首位のベンチマーク(主な例)
- DeepSWE v1.1(長期ソフトウェアエンジニアリング):77.9%で新たな最高水準。Opus 5.5は74.2%、GPT-6 Astraは74.1%
- Vals Index(金融・コーディング・法務・税務の経済的インパクト):68.9%で首位
- AutomationBench(Zapierを用いたエンドツーエンドのビジネス実行):51.3%で首位。Opus 5.5は42.5%
- Harvey Legal Agent Benchmark:19.6%。GPT-6 Astraの5.4%を大きく上回る
- LVBench(長尺動画理解):91.7%で新たな最高水準
Argonが後れを取るベンチマーク
- FrontierSWE v2:Argonが55.0%に対し、GPT-6 Astraが65.5%で上回る
- Terminal-Bench 4.0:Argonが57.4%に対し、Claude Opus 5.5が66.4%
- OSWorld-2.0(コンピュータ操作):Argonが69.2%、GPT-6 Astraが72.6%
すべてのカテゴリで優位というわけではなく、特にコンピュータ操作やターミナル操作では他モデルに及ばない領域があることが示されている。
サイバー防衛:「発見・検証・修正」を自律的に実行
Argonはソフトウェアの脆弱性を自律的に発見し、検証し、修正するよう訓練されているとGoogleは説明する。信頼できる防衛関係者やGoogle社内チームには、サイバー用のガードレールなしでアクセスが提供される。
脆弱性修正を評価するCWE-bench v1では68%で同率首位と報告されている。また、クラウドセキュリティ企業のWizはすでに「Scan for Good」イニシアティブを通じてArgonを活用しており、世界中の病院で使われている医療ソフトウェアの重大な脆弱性をArgonが発見したとGoogleは述べている。以前のフロンティアモデルはこの脆弱性を見つけられなかったとしている。
安全対策と段階的ロールアウト
Googleは広範なリリース前に4つの領域でセーフガードを強化するとしている。
- サイバーおよびCBRNリスクへの悪用防止:アクティベーション監視を含むFrontier Safety Frameworkに基づく
- 間接プロンプトインジェクション(IPI)耐性:Gray SwanのIPIベンチマークで首位と主張
- 思考の連鎖と行動の不整合モニタリング:実行を停止する能力を含む
- 高リスクな訓練・評価のための隔離サンドボックス
また、米国政府の自主的なプレリリースモデルアクセスプロセスに参加しており、初期テスターからフィードバックを収集した上でより広範なリリースへ向けてガードレールを改善する予定だという。現時点では一般アクセスは限定されている。
まとめ
Gemini 4 Argonは、出力トークン数の大幅な拡大と複数ベンチマークでのトップ性能を武器に、長期的・大規模なエンタープライズワークフローへの適用を強く意識したモデルと言える。一方で、コンピュータ操作や一部のソフトウェアエンジニアリング評価では競合モデルに後れを取る部分もあり、導入を検討する際には用途に応じた評価が求められる。