TIP
← Research

Research

LLMへの入力を「意味だけ差し替え・構造はそのまま」でプライバシーを守るフレームワーク「CROSS-MAP」

2026/09/23

LLM APIに送る前に「意味だけ入れ替える」という発想

ChatGPTをはじめとするLLM APIは、企業内ワークフローや医療・金融など機密性の高い領域にも急速に浸透しつつある。しかし、プロンプトをそのままクラウドAPIへ送信することは、第三者サービスへの情報漏洩リスクを伴う。既存のプライバシー保護手法(差分プライバシー、テキスト匿名化など)の多くは「元の意味をなるべく残しつつ、一部を難読化する」という方向で設計されてきた。論文著者らはこのアプローチの構造的な欠点を指摘する。意味を保ったまま変換すると、攻撃者が残存する意味的手がかりから元のテキストを復元できてしまうという問題だ。

「意味的分離(Semantic Decoupling)」という新パラダイム

エモリー大学のYuzhu MaoとLiang Zhaoは、論文「LLMs as Linguistic Chameleons」の中でセマンティック・デカップリングという概念を提案している。これは、テキストを「構造(Structure)」と「意味(Semantics)」に分解し、意味だけを別のドメインの内容に置き換えながら構造は保持するというアプローチだ。

論文中の例示が直感的にわかりやすい。「the thief robs the bank(泥棒が銀行を襲う)」「the waiter wipes the table(ウェイターがテーブルを拭く)」「the programmer tests the software(プログラマーがソフトをテストする)」は、それぞれ全く異なる意味を持ちながら、名詞+動詞+冠詞+名詞という同一の統語構造を共有する。LLMが「誰が何をするか」を推論するタスクであれば、意味を差し替えたテキストでも同じ論理推論が可能というわけだ。

変換のマッピング表(コードブック)は送信者側にローカル保管され、APIに送信されるのは意味を置き換えたテキストのみ。LLMの出力が返ってきたら、コードブックを使って元の文脈に対応する回答へ復元する。攻撃者がAPIとの通信を傍受しても、コードブックなしでは元の意味を復元することが極めて困難な設計となっている。

フレームワーク「CROSS-MAP」の仕組み

著者らが提案するCROSS-MAPは、このセマンティック・デカップリングを実現する双方向フレームワークだ。処理の流れは以下のとおり。

  1. マッピング段階:ローカルモデルが入力テキストを別の意味ドメインへ写像する。このとき統語構造は可能な限り保持したまま、意味は最大限に乖離させることを学習目標とする。
  2. 推論段階:意味を差し替えたテキストをLLM APIへ送信し、推論結果を受け取る。
  3. リカバリー段階:ローカルモデルがLLMの出力を元の意味文脈に対応した回答へ復元する。このとき意味的一貫性の損失を最小化することが学習目標となる。

この2つの目標(意味乖離の最大化と意味一貫性損失の最小化)を同時に達成するため、多目的最適化を採用している。論文によれば、Qwen-2.5-7B程度のコンパクトなローカルモデルをこの目標でファインチューニングすることで、実用的な品質が得られると報告されている。

情報理論的な裏付け

著者らは、セマンティック・デカップリングがセマンティック保存型アプローチより優れる条件を情報ボトルネック理論で形式化している。直感的には「タスクが意味内容への依存度が低い(=構造的推論で解ける)場合、かつ意味を差し替えることで得られる情報圧縮利得がタスク関連情報の損失を上回る場合」にCROSS-MAPが優位になることが定理として示されている。言い換えると、論理推論・感情分析・情報抽出など「構造的パターン」に基づく処理が多いタスクほど本フレームワークが有効と考えられる。

実験結果:再構築攻撃への耐性と実用性を両立

論文のアブストラクトおよび本文によれば、CROSS-MAPは複数の攻撃シナリオにおいて「テキスト再構築成功率の低減」を達成しつつ、既存ベースライン手法より下流タスクの精度で上回ったと報告されている。また著者らは防御側の視点だけでなく、ホワイトボックス攻撃(コードブックの一部が漏洩したシナリオを含む)に対する最適化ベース攻撃手法も独自に設計し、フレームワークの堅牢性評価に用いている。

背景:なぜ既存手法では不十分か

差分プライバシー(DP)はノイズの付加により実用性が低下しやすく、匿名化・サニタイズ系の手法は意味を保持する前提で設計されているため、変換後テキストから元の文脈が推測される余地が残る。論文が引用する先行研究では、変換後であっても「Aliceは深刻な病気の診断後、医療費のために貯蓄口座から5万ドルを引き出した」のような文からLLMが機密性の高い情報を推定できることが示されているという。CROSS-MAPはこの根本的な問題を、「意味そのものを別ドメインに差し替える」という発想で解決しようとするものだ。

まとめ

CROSS-MAPは、LLM APIへの問い合わせに含まれるプライバシーリスクに対し、従来の「意味を微妙に変えてごまかす」アプローチとは一線を画す方向性を示している。コードはanonymous.4open.scienceで公開されており、今後のオープンな検証が期待される。ローカルで動作するコンパクトなモデルを前提とした設計は、実装コストの面でも現実的な選択肢になり得ると考えられる。ただし、コードブック管理やリカバリー段階での意味ズレといった実用上の課題については、論文本文の末尾が切れている関係上、詳細な評価条件の全容は確認できていない点に注意が必要だ。


出典: LLMs as Linguistic Chameleons: Decoupling Semantics and Structure for Privacy-Preserving Communication