Research
「密なほど良い」は誤り――オンポリシー自己蒸留の継続的ポストトレーニングにおける限界を検証
2026/10/07
概要
大規模言語モデル(LLM)の継続的ポストトレーニング(Continual Post-Training)において、「オンポリシーなデータを使えば忘却を防げる」という楽観的な見方が広がっている。なかでも**自己蒸留(Self-Distillation)**はその有力候補として注目されてきた。香港中国科学院人工知能ロボット研究センター(HKISI, CAS)などを擁する研究チームは、この通説を実験的に再検証し、論文「Denser ≠ Better: Limits of On-Policy Self-Distillation for Continual Post-Training」(arXiv:2607.01763)としてまとめた。
結論として著者らは、自己蒸留ポリシー最適化(SDPO)は特定ドメインの特化に強い一方、継続学習においては既存知識の忘却を悪化させ、場合によってはモデル崩壊すら引き起こすと報告している。より確立された強化学習手法であるGRPOのほうが、能力保持の面で安定的だというのが主要な知見だ。
背景:なぜ自己蒸留が注目されるのか
実用的なAIシステムは複数のドメイン・スキルにまたがる継続的なポストトレーニングを必要とする。既存研究では、報酬ベースの強化ファインチューニング(RFT)は教師あり学習(SFT)より忘却が少ないとされており、この恩恵はオンポリシーデータの利用に帰因されることが多い。
さらに近年、オンポリシー蒸留はトークンレベルの密な監視信号を生成することで、外部の報酬モデルを不要にしつつクレジット割り当てを改善する手法として注目されている。特に自己蒸留では、モデル自身がデモンストレーションやフィードバックを条件にした教師として機能し、その挙動を同じモデルに蒸留し直す。SDPOはこのアプローチの代表例であり、フィードバック条件付き教師が生成するトークンレベルの監視信号を学生ポリシーに提供する仕組みだ。
実験設計:2つの問いを検証
研究チームはSDPOとGRPOを比較する実験を、シングルドメインおよびマルチドメインの継続学習設定で実施した。比較の軸は以下の2点だ。
- オンポリシー自己蒸留が有効に機能する条件は何か
- SDPOはGRPOを汎化性能や継続学習において上回るか
評価は数学(Math)・科学(Science)・ツール利用(ToolUse)・コーディング(Coding)の各ドメインと、分布外(OOD)ベンチマーク(GPQA、ZLogic、MMLU-R など)で行われた。
主要な知見1:教師の安定性と鮮度のジレンマ
SDPOでは教師モデルのEMA(指数移動平均)更新レート α を変えた実験が行われた。直感的には、教師を頻繁に更新するほど学生の最新状態を反映できるはずだ。しかし実験結果は逆説的な傾向を示したと報告されている。
- Math トレーニングでは α=1% が最良だったが、α=5% は最悪の結果となった
- ToolUse トレーニングでは教師を固定(α=0)した場合が最良だった
著者らはこの現象を「EMAは鮮度と安定性を混同している」と解釈する。更新率が大きいほど教師は動く標的になり、SDPOがトークン単位で監視信号を適用するため、教師のわずかな揺らぎが応答全体で何度も強化されてしまう。訓練曲線ではエントロピーとJS divergenceの急増が観察され、教師と学生の乖離が拡大していることが示唆されると述べられている。
対策として研究チームが提案したのが**「リスタート・アンド・フリーズ戦略」**だ。連続的なEMA更新の代わりに、定期的に教師を現在の学生で再初期化し、次のインターバルは固定したまま保持する。AIMEスコアで見ると、α=5% のEMAでは34.38%だったのが、対応する γ=40% のリスタート戦略では55.00%に改善したと報告されている(平均スコアも65.34%→71.84%、+6.50ポイント)。
主要な知見2:CoT蒸留は「多ければ良い」ではない
次に著者らは、Chain-of-Thought(CoT)トークンを蒸留に含めることで監視信号をさらに密にした場合を検証した。もし密な監視が一様に有益なら、CoT蒸留は常に性能を向上させるはずだ。
結果はそうならなかったと報告されている。CoT蒸留はToolUseでは有効に機能したが、MathとScienceでは性能を低下させた。著者らはこの違いを中間トークンの信頼性で説明する。
- ToolUseのトレースは短くスキーマで制約されており、CoTはプロセス監視として機能する
- 一方、長文のMath・Scienceタスクでは推論軌跡が過剰決定されておらず、冗長な自己チェックや不確かな解釈、書式上の癖、誤った中間ステップが混入しやすい。これらを蒸留することでクレジット割り当てが希薄化し、推論アーティファクトの模倣を促してしまう
さらに教師を高頻度で更新した場合にCoT蒸留がとりわけ有害になると報告されており、ノイジーな推論パターンが教師に取り込まれ再強化される「確証バイアスループ」の存在が示唆されている。
主要な知見3:継続学習では忘却が悪化し崩壊も
続いて、4タスクを順次学習する継続学習設定でGRPOとSDPOを比較した。著者らによれば、SDPOはGRPOと比べて既存能力の忘却が大きく、場合によってはモデルが崩壊するという。
- GRPOはより保守的に適応し、以前の能力を良好に保持する
- SDPOはパラメータ空間・応答空間での大きなドリフトを引き起こす
- 自己強化的な教師-学生ループにより高周波アーティファクトが増幅される
論文が提示するFigure 1では、GRPOが各タスク学習後もOODベンチマーク上の相対スコアを概ね維持しているのに対し、SDPOはドメインをまたぐたびに性能が不安定になるさまが可視化されている。
また著者らはこの失敗を理論的にも分析し、SDPOが余剰なKLダイバージェンスを生じさせるメカニズムを示している。
解釈と結論
著者らは、「オンポリシーデータ」と「それを更新に変換するための目的関数」という2つの要因が、先行研究では混同されていたと指摘する。オンポリシーサンプリングはどの履歴でモデルが訓練されるかを決めるが、訓練目的は各履歴でどの継続分布が強化されるかを決める。この区別が密な自己蒸留では特に重要だという。
結論として著者らは次のように述べている。
- SDPOは強力な特化手法であるが、教師信号が安定しておりトークンレベル監視が信頼できる場合に限る
- 継続的ポストトレーニングのデフォルト安定化手法として自己蒸留を採用すべきではない
- オンポリシーデータだけでは継続学習に不十分であり、GRPOのような系列レベルの報酬最適化のほうが能力保持面で堅牢だ
出典: Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training