TIP
← Research

Research

LLMの法律QAにおける「時間的失敗」を診断・軽減――ドイツ法312問ベンチマークの知見

2026/09/30

LLMと法律の「時間」問題

法律の世界では、同じ条文でも「いつの版か」が答えを左右する。ミュンヘン工科大学(TUM)のMax Prior氏ら研究チームは、大規模言語モデル(LLM)が法定条文の問答(Statutory QA)において陥りやすい二種類の時間的失敗モードを体系的に診断・軽減する研究を発表した。論文は国際AI・法律会議(ICAIL 2026、シンガポール)に採択されており、データセットはGitHubで公開されている。

二つの「時間的失敗モード」

研究チームが定義した失敗モードは以下の二つだ。

  • Post-Cutoff Staleness(カットオフ後の陳腐化): 学習データの締め切り日(知識カットオフ)以降に改正された法律を問われた際、モデルが旧版の規定を適用してしまう問題。
  • Recency Bias(最新性バイアス): 過去の特定時点の法律が適用されるべき事実関係においても、モデルが最新版の条文を優先してしまう問題。

Thomson Reutersの2025年調査によれば、LLMツールの法律実務での利用率は2024年の14%から2025年には26%に増加し、日常的に使う弁護士は40%、活用場面では法律調査が73%を占めるという。また、バイエルン州弁護士会(BAV)が2024年に実施した調査でも、AIの活用予定・実施分野として法律調査を挙げた弁護士が73.1%に達したと報告されている。こうした普及の一方で、LLMの時間的堅牢性への認識は十分でないと著者らは指摘する。

ベンチマークの設計

研究チームはこの問題を定量的に評価するため、312問の専門家検証済みドイツ法QAペアからなるベンチマークを構築した。問題は三カテゴリに分類される。

  1. Post-Cutoff Amendment Questions: 対象LLMの知識カットオフ後に改正された条文に基づく問題。正解には改正後の知識が必要。
  2. Pre-Amendment Questions: 過去の特定時点の法律版を適用しなければならない問題。
  3. Multi-Provision Pre-Amendment Questions: 複数の条文にまたがる歴史的適用を問う問題。

扱われた法令は、民法典(BGB)、刑事訴訟法(StPO)、租税基本法(AO)、所得税法(EStG)、連邦建設法典(BauGB)、商法典(HGB)の六法に及び、特定の教科書的事例への偏りを避けるよう設計されている。問題はGemini 3 Pro PreviewをベースとしたLLMパイプラインで合成生成されており、実質的な権利・義務・期限・閾値等が変化した改正のみを対象とした。

ドイツには過去の公式統合版法令をマシンリーダブルな形で提供する公的DBが存在しないため、民間サービスの buzer.de を使用したと著者らは説明している。

実験設定と評価

評価対象となったLLMはOpenAI・Anthropic・DeepSeekの計5モデル(論文では具体的にChatGPT-5.1、Claude Sonnet 3.7、ChatGPT-5.2、Claude 4.5 Opus、DeepSeek v3.2が挙げられている)。推論設定は四種類だ。

  • Vanilla: 外部情報なしの素のプロンプト
  • Web Search: ウェブ検索を組み合わせた設定
  • RAG-kNN: 事実日付を抽出し、k近傍法でバージョンフィルタリングを行うRAG
  • RAG-ToC: 目次(Table of Contents)構造を利用したバージョンフィルタリングRAG

評価には LLM-as-a-Judge 手法が用いられ、人間専門家の評価と照合して妥当性が検証されている。

主な結果

論文によれば、Vanilla設定のPost-Cutoffタスクにおいて深刻な性能低下が観察されたという。一方、RAG-kNNとRAG-ToC の両アプローチは全問題カテゴリで大幅な改善をもたらした。

Web検索は不安定な改善効果にとどまり、歴史的な時点を問うタスクでは顕著な最新性バイアスを示したと報告されている。これは、LLMベースのリランカーが文書の「新しさ」を暗黙の関連性シグナルとして扱う傾向(Fang et al.の先行研究が指摘)とも整合する結果だ。

また、能力の高い最新モデルでも、事実関係が過去版の適用を求める場合に最新の法的知識を上書きすることに頻繁に失敗すると著者らは述べている。

先行研究との比較と意義

既存のドイツ法QAデータセット(GerLayQA など)は改正のあった条文を除外するフィルタリングを施しており、カットオフ後の陳腐化や最新性バイアスを直接測定できない設計だったと著者らは指摘する。英米法を対象とした Zhang et al.のデータセットはあるものの、大陸法(シビル・ロー)体系を対象にした同種のベンチマークは存在しなかった。本研究はその空白を埋めるものと位置付けられている。

結論

著者らは「信頼できる法律QAには、時制的有効性をハード制約として扱うことが必要だ」と結論付けている。RAGに日付フィルタリングを組み込むことが現時点で最も効果的な対策であり、ウェブ検索の単純な付加では不十分であることが示されている。法律AIの実用化が進むなか、モデルの「いつの法律を知っているか」という問いへの解像度を高める必要性を、本研究は改めて浮き彫りにした。


出典: Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering