Research
MoEルーティング信号で「存在しない物体への質問」を生成前に検出——Qwen3/Gemma4で最大22ポイント精度向上
2026/10/02
「存在しない犬は何色?」——VLMが抱える誤前提受容の問題
画像に犬が映っていないにもかかわらず、「この犬は何色ですか?」と尋ねると、視覚言語モデル(VLM)はもっともらしい色を答えてしまうことがある。UCLA と北京大学の研究者らはこの問題を 「ターゲット不在グラウンディング失敗」 と定義し、Mixture-of-Experts(MoE)型 VLM の内部ルーティング信号を活用してこの失敗を生成前に検出するフレームワークを提案した。論文は arXiv(arXiv:2609.38111)に公開されている。
既存手法の限界とルーティング信号という新しい切り口
従来のビジュアルグラウンディング検出器は、生成済みレスポンス・隠れ状態・不確実性指標に依存するものが中心だった。一方、MoE アーキテクチャでは各レイヤーのルーターがトークンごとに担当エキスパートを割り当てており、この「計算リソースの配分記録」が視覚的証拠の有無を反映しているかどうかはこれまで検討されていなかった。
研究チームは、ターゲット名詞句のトークン位置におけるルーティング確率 がターゲット不在の検出に有効かどうかを実証的に調べた。
フレームワークの仕組み
ステップ1:ターゲットトークンのルーティング表現を抽出
ルールベースの凍結済み抽出器でクエリ中のターゲット名詞句を特定し、トークナイザーでその位置を取得する。標準プロンプトのプレフィル中、各 MoE レイヤーでルーターの事前選択分布を記録し、ターゲットスパン全体で平均した後、全レイヤー・全エキスパートにわたってベクトルに結合する。
Qwen3-VL-30B-A3B-Instruct の場合、レイヤー数 L=48、エキスパート数 E=128 となり、1入力あたり 6,144 次元のルーティングベクトルが得られると論文は説明している。
ステップ2:L2 正則化線形プローブで不在を予測
抽出したルーティングベクトルを学習分割の統計値で標準化し、L2 正則化ロジスティック回帰(線形プローブ)に入力する。プローブは各モデルに対して個別に学習され、テストデータや外部データへの適用時には学習統計・重み・閾値がすべて凍結される。線形モデルであるため、レイヤー・エキスパートレベルでの解釈が直接可能だとしている。
ステップ3:不在スコアに基づく選択的レビュー
予測スコアが閾値を超えた場合のみ、ターゲット認識型レビュープロンプト を追加して同じ VLM に再生成を依頼する。閾値を下回る場合は標準レスポンスをそのまま使用する。モデルの重みもルーターのパラメーターも一切変更しない。レビューコストは発火率に比例するため、全入力を毎回レビューするより期待コストを抑えられるとしている。
実験結果:ROC-AUC 0.99 超、精度向上は最大 22 ポイント
論文によれば、GQA-Inpaint データセット上でのテスト ROC-AUC は Qwen が 0.9988、Gemma が 0.9956 と報告されている。外部データセット OBER への転移でも ROC-AUC はそれぞれ 0.8095 および 0.7781 を維持したとしている。
ルーティングゲート型レビューポリシーのエンドツーエンド精度向上は以下の通り報告されている。
| モデル | GQA-Inpaint | OBER |
|---|---|---|
| Qwen3-VL-30B-A3B-Instruct | +22.25ポイント | +12.17ポイント |
| Gemma-4-26B-A4B-it | +13.42ポイント | +1.39ポイント |
信号の構造:どこでどう現れるか
詳細分析では以下の特性が確認されたと論文は述べている。
- 信号の局在性:ターゲット物体トークンに集中して現れる
- 早期出現:MoE の初期レイヤーで信号が生じる
- 分散性:部分的に代替可能な複数のエキスパートにまたがって分布する
この結果は、内部ルーティングと最終的な出力挙動のミスマッチを示すものでもある。すなわち、ルーティングは最終的な回答が無視してしまう視覚的証拠の欠如を捉えることができるという。
課題と今後の展望
一方で、GQA-Inpaint で調整した決定閾値は OBER への転移精度が低下する「クロスデータセット閾値シフト」が観察されており、外部データへの適用には再キャリブレーションが必要だとしている。偽陽性レビューによる悪影響は限定的だったとも報告されており、検出器閾値とレビュープロンプトを組み合わせて介入リスクをコントロールできる可能性を示唆している。
研究チームは、本フレームワークが外部ビジョンモデルや繰り返しデコーディングを必要とせず、MoE VLM が生成済みの計算情報だけで低コストな視覚グラウンディング検出と選択的補正を実現できることを示したと主張している。
出典: From Routing Signals to Selective Review: Visual regrounding in MoE VLMs