TIP
← Research

Research

「教師あり蒸留」は本当に蒸留しているのか? ノイズだらけの教師信号と教師不要の自己改善手法「OPSA」

2026/09/26

「教師あり蒸留」は本当に蒸留しているのか?

パデュー大学のYi DingとRuqi Zhangによる論文「Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement」が、大規模言語モデル(LLM)の後訓練手法として注目を集めているオンポリシー蒸留(On-Policy Distillation、OPD)の根本的な動作原理に疑問を投げかけている。

OPDとは何か、何が問題なのか

OPDは、検証可能な報酬を用いた強化学習(RLVR)が応答レベルの粗いスコアしか与えられないという欠点を補うために提案された手法だ。強力な教師モデルが、生徒モデルのサンプリングした軌跡に対してトークンレベルの密な報酬を与えることで、より細かい学習信号を提供する。

しかし根本的な問題がある。教師はあくまで生徒が生成した軌跡を事後評価するため、教師自身が生成するであろう軌跡とは本質的にずれた(オフポリシーな)文脈でスコアを付けなければならない。このとき教師の監督信号がどれほど信頼できるのかが不明確だったと著者らは指摘する。

教師信号の「ノイズ率」は教師の規模とともに増大する

著者らはQwen3-1.7Bを生徒モデル、Qwen3-4B・30B-A3B・235B-A22B-Instructを教師モデルとして実験を行い、教師信号のノイズを定量化した。ここでいう「ノイズ」とは、正解回答に負の優位度(アドバンテージ)を与えたり、誤答に正の優位度を与えたりする信号を指す。

論文によれば、4Bの教師を用いた場合でもノイズ率は30.6%に達し、正解軌跡の20.4%が負のアドバンテージを受け、誤答軌跡の40.8%が正のアドバンテージを受けていたという。さらに教師の規模が大きくなるほどノイズは増え、30B-A3B教師では34.7%、235B-A22B教師では50.6%に上昇した。

最大規模の235B教師に至っては、\boxed{}内の正解トークンの97.8%、誤答トークンの96.6%に対して一律に負のアドバンテージを付与していたと報告されており、答えの正誤にほぼ無関係な信号になっていたとされる。著者らはこれを、教師と生徒の分布のずれが大きくなるほど、生徒生成の軌跡が教師にとって極端にオフポリシーになるためと解釈している。

「ノイズだらけの信号でも生徒は改善する」という驚くべき事実

さらに驚くべきことに、ノイズの多い軌跡だけで学習させた場合でも、ノイズを除いた軌跡だけで学習させた場合と同等の性能に収束したと著者らは報告している。ノイズありの軌跡のみ・ノイズなしの軌跡のみ・標準OPDの3条件すべてが、ほぼ同等のステップ数で同等の精度に達したという。

この結果は、OPDの改善が教師の知識転移によるものではない可能性を強く示唆しており、著者らは「何が生徒の改善をもたらしているのか」という問いに正面から向き合った。

改善の真因:低確率トークンの抑制

詳細な分析により、著者らは次の二点を特定したと報告している。

  1. どのトークンが重要か: 生徒が高い対数確率(high logp)を割り当てたトークンには、教師も同程度の確率を付与するため、アドバンテージがほぼゼロになる。OPDによる改善は専ら、生徒が低確率でサンプリングした「低logpトークン」に集中している。

  2. どの学習信号が重要か: OPDのアドバンテージをすべて固定の負値に置き換えても、標準OPDと同等の性能が得られた。つまり、細かな教師信号ではなく「低確率トークンを抑制する」という負のシグナル自体が改善の鍵だということだ。

これらの知見をまとめると、「OPDは教師の行動に生徒を近づける蒸留として機能しているのではなく、低確率トークンを抑制する正則化として機能している」という結論になる。

提案手法:教師不要のOPSA

この発見をもとに著者らが提案したのが On-Policy Self-Adaptation(OPSA) だ。OPSAは教師モデルをまったく必要とせず、エントロピー適応型の負アドバンテージ を低確率トークンに割り当てる。

具体的には、トークン位置のエントロピーが高いほど(=モデルが迷っている分岐点ほど)強い負のシグナルを与え、テールトークン(低確率側)の確率を抑制しながら、ヘッドトークン(高確率側)への確率質量を再配分する。エントロピーの低い確信度の高い位置では分布をシャープに保ちつつ、エントロピーの高い探索的な分岐点では多様性を維持する設計だという。

実験結果

論文では、Qwen3-1.7Bをベースモデルとして、AIME24をはじめとする数学推論ベンチマークで評価した結果が示されている。

  • Avg@32 でOPDを16.77ポイント上回った(AIME24)
  • ベースモデル比でAvg@32が 263%〜307% 向上(3つのベンチマーク全体)
  • 3つのベンチマーク全てでPass@32が 2倍以上 に

著者らは複数のモデルファミリーとタスクにわたる追加実験でもOPSAの有効性と汎化性を確認したと報告している。

意義と今後の課題

この研究が示す最大の示唆は、「大規模教師モデルを用いた蒸留という直感的に魅力的な枠組みが、実際には意図したメカニズムで動いていない可能性がある」という点だ。教師信号のノイズが教師規模とともに増大するという知見は、より大きな教師ほど良いという一般的な仮定にも再考を迫る。

ただし、本論文はアブストラクトおよび本文前半の分析・提案部分に基づいており、末尾の実験詳細や考察が一部欠落している可能性がある点は留意が必要だ。コードとモデルはHugging FaceおよびGitHubで公開予定とされている。


出典: Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement