TIP
← 記事

セキュリティ

日本語のエージェント攻撃評価はなぜ手薄か — 翻訳で埋まる部分と、埋まらない部分

2026/10/03

本文を入力してください。1. 評価素材の言語が偏っている LLMがメール、文書、Webページ、ツールの出力を読んで動く時代になり、外部データに仕込まれた指示にエージェントが従ってしまう間接プロンプトインジェクションは、実務上の主要なリスクになった。評価のための素材は、AgentDojo、InjecAgent、BIPIA、NVIDIAのNemotron系データなど、英語では一定にそろっている。一方、日本語で同じ観点を測る公開素材は、調べた範囲ではほとんど見当たらなかった。

日本語の有害依頼や拒否挙動を扱うデータは、既にいくつか公開されている。扱う問いが違う。ここで足りないのは、エージェントが外部データ経由で受け取る指示に従うかどうかを、日本語の環境で測る素材だ。

  1. 翻訳で埋まる部分 英語のベンチマークを日本語に訳すだけでも、価値のある部分は大きい。実際に、主要な4つを日本語化して公開した。

AgentDojoの日本語版(banking、slack、travel、workspaceの4スイート。ユーザータスク97件、攻撃タスク31件。本家と同じ件数とID) InjecAgentの日本語版(1,054件×2設定、ツール定義つき) BIPIAの攻撃文の日本語版(250件) Nemotron-RL-Agentic-Indirect-Prompt-Injectionの日本語版(1,272件) 翻訳の設計にはいくつか発見があった。

InjecAgentの2,108件のテストケースは、テンプレートに攻撃指示を差し込んだ構造で、実際に訳す必要のあるユニークな文字列は175個だった。差し込みの規則で英語版の全件を再現できることを確認したうえで、翻訳済みの文字列から組み立て直した。全量を訳すより、訳す単位を見つけるほうが、検証も容易になる。

  1. 判定が英語の識別子に依存する Nemotron系のデータでは、判定器が「英語のツール名と引数の値が一致したか」を決定的に検査する。注入文を日本語に訳すとき、引数にあたる文字列(理由、件名、タイトルなど)まで訳されると、エージェントが指示に従っても判定が成立しない。

Amazon NovaのLiteで試したところ、40件のパイロットのうち17件でこの不整合が出た。注入文だけを個別に、引数の文字列を原文のまま保つ制約つきで訳し、落ちた場合は言い直しを求める作りにすると、40件すべてが通り、全1,272件のうち1,270件が全検査を通った。翻訳データの品質は、訳文の自然さだけでなく、元の検証器が壊れないことでも測る必要がある。

  1. 翻訳だけでは届かない日本語固有の攻撃面 日本語には、英語にない攻撃面がある。

文字種の混在: 漢字、ひらがな、カタカナ、全角英数、半角カナが同じ文章に現れる 敬語と婉曲: 丁寧な依頼の形で指示が書かれると、命令と依頼の境界が曖昧になる 金融の経路: 銀行振込の摘要欄は、全銀形式では半角カナと英数字が基本とされ、攻撃文が通る経路の性質が違う可能性がある(一次資料での確認は、これからの作業だ) BIPIAの代替文字種を使う攻撃(置換、アナグラム、シーザー暗号など)はラテン文字を前提としており、日本語にはそのまま当てはまらない。そこで、ひらがな化、カタカナ化、半角カナ化、五十音ずらし、同音異字、敬語レベルの変更などの日本語固有の攻撃を、10カテゴリ50件追加した。ただし、これらがモデルの挙動にどう効くかは、まだ体系的には測れていない。

  1. 動作の確認と、わかったこと Claude Haiku 4.5で、攻撃なしの有用性を日本語版と英語版(本家)で比べた。日本語版は76/97、英語版は75/97で、日本語版が極端に難しい、あるいは易しいということはなかった。この件数では1件の差は誤差の範囲にとどまる。失敗の多くは、確認や質問で止まる挙動と、答えに必要な情報の欠落で、日本語に固有の問題ではなかった。

本家の検証過程では、本家側の不備も見つかった。一部の攻撃タスクの正解手順が空で、本家自身の整合性検査が失敗する。ツール出力の非ASCII文字がエスケープされた形でモデルに渡る。どちらもissueとして報告し、日本語版では前者に動く正解手順を付けた。

  1. 残る課題 現状の評価素材には、はっきりした限界がある。

翻訳は機械翻訳と自動検証だけで、ネイティブによる査読は済んでいない プローブは件数が小さく、複数回のサンプリングや信頼区間がない 量子化したローカルモデルで、日本語の攻撃に対する耐性がどう変わるかは、未測定 量子化と安全性の関係、GGUFのチャットテンプレートを介した攻撃、評価に誤差範囲をつける考え方は、英語圏では既に研究がある。日本語固有の表記変換が、量子化後のモデルでどのように効くか。ツール呼び出しの日本語引数が、変換後も正しく保たれるか。変換した配布物にペア検定つきの検証結果を添えて配布する運用が成立するか。調べた範囲では先行例が見当たらないこれらの問いが、次の段階の測定対象になる。

素材は、ハブのリポジトリ(github.com/masahiroid/japanese-llm-security)から辿れる。


出典: 新規記事