TIP
← 記事

AI

Microsoft、約3500行の軽量エージェントRLフレームワーク「Agent Lightning v1.0」を公開——SWE-benchで14.6ポイント改善

2026/10/08

既存エージェントを壊さずにRLトレーニングへ接続

Microsoft Research Asiaは、AIエージェントの強化学習(RL)トレーニングを効率化する軽量フレームワーク「Agent Lightning v1.0」をオープンソースとして公開した。同フレームワークのコードベースは約3500行と、完全なエージェントRLコントロールプレーンとしては異例の小ささを誇るとされている。

従来のエージェントRLでは、トレーニングフレームワーク側が環境とのインタラクションループを管理する必要があり、開発者はデプロイに使用しているエージェントを学習フレームワーク内で再実装しなければならなかった。しかしこの再実装はコストが高く、実際にデプロイされるエージェントとトレーニング中のエージェントの挙動が一致しない問題もあった。

Agent Lightning v1.0はこの課題に対し、「Harnessed Agentic RL」と呼ぶ新しいトレーニングパラダイムを導入する。エージェントとモデルの間にLLMプロキシを配置し、既存のハーネスコードを変更せずにモデルAPIのエンドポイントをAgent Lightningに向けるだけで、トレーニングフレームワークがモデルへの呼び出しを観察・記録できる仕組みだ。つまり、デプロイで使われるエージェントハーネスがそのままRLトレーニングに参加するという設計である。

3つのコアコンポーネント構成

システムは以下の3つのコアコンポーネントで構成されると説明されている。

  • APIゲートウェイ: ロールアウト・モデル・イベントを格納し、OpenAI互換のLLMプロキシとして機能。ハーネスからのモデル呼び出しをロールアウトに紐付け、プロンプト・レスポンス・対数確率を記録する
  • ロールアウトコントローラ: エージェントの実行をローカルプロセスまたは標準のKubernetesジョブとして起動・管理し、トレーナーとエージェント実行を分離する
  • カスタマイズドトレーナー: verlをベースに構築され、ロールアウトの生成・完了待機・サンプル収集・最終的なトレーニングサンプルの組み立てをサンプルアダプタ経由で行う

Harnessed Agentic RLが抱える4つの技術的課題

エージェントハーネスが環境とのインタラクションループを担うことで、トレーニングシステムがLLMのリクエスト・レスポンスのペアとしてしかロールアウトを観察できないという構造上の課題が生じる。ブログでは以下の4点が挙げられている。

  1. 再トークン化とサンプルのマージ: ハーネスはコンテキストをテキストで保持するが、RLトレーニングにはロールアウト中にサンプリングされたトークンIDが必要となる
  2. アドバンテージ計算: 再トークン化やサブエージェントによって1ロールアウトが複数サンプルに分割され、ロールアウトレベルの統計的関係が崩れる恐れがある
  3. 損失の正規化: サンプル数で損失を平均するとサンプル数の多いロールアウトに過大な重みが生じる
  4. トレーニングバックエンドのスケジューリング: サンプル数と長さはハーネスが終了するまで不明な一方、GPU数や並列構成は固定されている

Collocated Async RLで同期型の約2倍のスループット

エージェントごとにロールアウト時間が大きく異なるため、同期型RLでは最も遅いエージェントを待つ間GPUがアイドル状態になる問題がある。一方、完全非同期型RLはGPU利用率を高めるが、ロールアウトとトレーニングで別々のGPUプールが必要になる。

Agent Lightning v1.0が導入する「Collocated Async RL」は、ロールアウトとモデル更新が同一のGPUセットを共有する方式だ。十分なロールアウトが収集されると更新フェーズに移行し、APIゲートウェイが新規リクエストの受け付けを一時停止して進行中のリクエストが完了するのを待つ。更新が完了するとロールアウトが再開され、この状態遷移は外部のエージェントハーネスには透過的であるとされている。ブログによれば、実験でこのアプローチは同期型RLに対してエンドツーエンドで約2倍の高速化を達成し、従来の非同期型RLより少ないGPU数で実現できたという。

商用サンドボックス不要、Kubernetesで大規模ロールアウト

ロールアウトを大量に収集するには多数のエージェントを同時実行する必要があり、CPU・メモリ・コンピュートリソースを大量に消費する。他のHarnessed Agentic RLフレームワークでは商用サンドボックスサービス(Modal SandboxやE2Bなど)を利用するケースが多く、スケールアップに伴いコストが急増する課題があった。Agent Lightning v1.0では、エージェントを標準のKubernetesジョブとして実行することで、既存の自己管理クラスタ・クラウドKubernetes・ローカルインフラをそのまま活用できると説明されている。

SWE-bench Verifiedで14.6ポイント向上

Agent Lightning v1.0の実力を示す実験結果として、Qwen3.5-9BをベースにしたコーディングエージェントパイプラインがSWE-bench VerifiedのPass@1スコアを41.8%から56.4%へ向上させたと報告されている。絶対値で14.6ポイントの改善であり、使用したトレーニングサンプルはオープンソースデータセットから得た約6000件のみとされている。サポートされるエージェントハーネスとしてはmini-SWE-agent、OpenHands、OpenClawなどが例示されている。

オープンソースで再現可能なパイプラインとして公開

Agent Lightning v1.0はMicrosoftのGitHubリポジトリ(microsoft/agent-lightning)として公開されており、研究者や開発者が自身の環境でパイプライン全体を再現できることを設計目標の一つとして掲げている。軽量なコードベースと明確なコンポーネント分割により、理解・改変・拡張が容易であることも強調されている。


出典: Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses