Research
LLM推論を加速する投機的デコードの新訓練目標「EDR」——デコードラウンド期待値を直接最小化
2026/10/10
投機的デコードの訓練における未解決課題
大規模言語モデル(LLM)の推論速度を高める手法として広く研究されている投機的デコード(Speculative Decoding)は、軽量な「ドラフトモデル」が複数のトークン候補を先行提案し、フルサイズのターゲットモデルが一括検証することで、逐次生成のボトルネックを緩和する技術だ。
この枠組みにおいて、ドラフトを1回のフォワードパスでブロック単位に生成する並列ドラフターおよび半自己回帰(semi-AR)ドラフターは、逐次型のARドラフターに比べてドラフト工程自体のレイテンシを削減できる有力なアプローチとして注目されている。しかし、これらのモデルを訓練する際には従来なかった困難が生じると、ミシガン大学の Yunxiao Zhao・Changxiao Cai 両氏は論文で指摘する。
問題の核心はラウンド間の結合にある。並列・semi-ARドラフターでは、あるトークン位置の提案分布が「そのデコードラウンドがどこから始まったか」に依存する。そしてラウンドの開始位置は、直前ラウンドで何トークンが受理されたかによって決まる。つまり、ドラフターを変えると受理パターンが変わり、後続ラウンドで遭遇するドラフト分布まで変化するという循環的な依存関係が生まれる。
既存の訓練目標は、こうしたラウンドをまたぐ依存性を無視したブロック局所的な代理指標(例:1ラウンド内の受理トークン数の期待値や、手動重み付きの分布乖離)に頼っており、デコードラウンド数という大域的な効率指標を直接最適化していないという課題があった。
Markov報酬過程による定式化と「EDR」目標関数
著者らはこの問題に正面から取り組み、投機的デコードを**Markov報酬過程(MRP)**として定式化することで理論的な枠組みを構築した。
状態 $(n, t)$ は「ラウンドが位置 $n$ から始まり、現在位置 $t$ を検証中」であることを表す。各ラウンドの終了(棄却)が1ラウンドのコストを発生させ、デコード全体は MRP 上のパスとして記述される。出力系列はドラフターの種類にかかわらずターゲットモデルの分布に従うことが保証されているため、ターゲットモデルのロールアウトから平均を取ることでデコードラウンド数の期待値を正確に回収できると著者らは示す。
この定式化から導かれるのが、論文の中心となる目標関数 EDR(Expected Decoding Rounds) だ。EDRは各位置の棄却コストを状態占有確率で重み付けしたものであり、期待デコードラウンド数と厳密に等しい。従来の代理目標と異なり、追加のハイパーパラメータを必要としない点が特徴として強調されている。
さらに著者らは、EDR の勾配をターゲットモデルのロールアウトから不偏確率的最適化できるTemporal-Difference(TD)勾配推定量を導出した。これにより、オンラインで投機的デコードを実行しなくても、共有されたターゲットロールアウト上でドラフター同士を比較できるオフライン評価器も同一フレームワークから構築できるという。
また論文は理論的な証明として、各ラウンドの受理期待長を最大化するドラフターが EDR においては厳密に劣化し得ることを示しており、ブロック局所的な目標を用いる既存手法の限界を数理的に裏付けている。
9ベンチマークで既存手法を上回る実験結果
実験では、最先端の並列・semi-ARドラフターである DSpark および DFly を対象に、アーキテクチャや推論手順は変えずに EDR でファインチューニングを実施した。評価は数学的推論・コード生成・チャットにまたがる9つのベンチマークで行われた。
論文によれば、1エポックのEDRファインチューニングのみで、両ドラフターの平均受理長(MAL)が元のドラフターおよび既存訓練目標を一貫して上回ったと報告されている。具体的な数値は本文中の実験セクションに詳述されているが、末尾が切れている可能性があるため、各ベンチマークの詳細については原論文を参照されたい。
貢献のまとめ
著者らは本研究の主要貢献を4点にまとめている。
- Markov報酬過程による定式化 — 並列・semi-ARドラフターの期待デコードラウンド数を厳密に特徴づける理論的枠組みの提供
- 厳密かつ訓練可能なグローバル目標関数 EDR — 期待デコードラウンド数の最小化と等価であることの証明、TD勾配の導出、ブロック局所目標との比較での優位性の理論的確認
- 厳密なオフライン評価器 — 同一のターゲットモデルロールアウト上でドラフターを比較可能にするペア評価手法
- 一貫した実験的改善 — 2つの最先端ドラフターを9ベンチマークで改善し、既存訓練目標を超える性能を達成
コードは GitHub(y-x-zhao/AngelSpec-EDR)で公開されており、実装の再現が可能となっている。投機的デコードの訓練を大域的効率指標から直接アプローチするという本手法は、LLM推論の高速化研究に新たな理論的基盤を提供するものとして注目される。
出典: Training Parallel Speculative Draft Models by Directly Minimizing Expected Decoding Rounds