TIP
← 記事

AI

GboardがTEEベースの連合学習を採用——外部検証可能な差分プライバシーをGoogleが実現

2026/10/07

GoogleがTEEベースの次世代連合学習システムを発表

Google Researchは、信頼実行環境(TEE: Trusted Execution Environment)を基盤とした次世代の**連合学習(Federated Learning: FL)**システムを発表した。研究チームは、FLにおける中央差分プライバシー(DP)の保証を外部から検証可能な形で実現したのは初めてだと報告している。

Googleが2017年に導入した連合学習は、Gboardの次単語予測やSmart Compose、Google MessagesのReply Suggestions、AndroidのSmart Text Selectionなど、幅広いサービスを支えてきた。

従来システムの「信頼のギャップ」

これまでの連合学習システムには構造的な課題があった。デバイスがアップロードしたデータが記録・閲覧されていないことを、外部の第三者が検証できなかった。暗号的保護を加えるSecure Aggregationが導入されたものの、最先端のDP手法であるMatrix Factorization DP-FTRLとの互換性がなく、Googleが正しくDPノイズを付加しているかどうかを外部から確認する手段も存在しなかった。

新システムでは、クライアント側でのグラジェント計算をサーバー側のTEEに移行することで、オペレーターを盲目的に信頼しなくても済む設計を実現したと報告されている。

システムの仕組み:4つのコアコンポーネント

新システムはGoogleが以前公開した「Confidential Federated Analytics」の研究を基礎とし、以下4つの主要コンポーネントで構成されると説明されている。

1. データアップロード

デバイスはトレーニングデータをローカルで暗号化したうえでアップロードし、処理を許可するTEEワークロードの一覧をアクセスポリシーとして事前に登録する。このポリシーは公開透明性ログに掲載されることが必須条件となっている。

2. KMSとポリシー検証

RAFTコンセンサスプロトコルを実行するTEEクラスターで構成されるKey Management System(KMS)が、アクセスポリシーに合致するワークロードにのみ復号鍵を渡す設計になっている。

3. ワークロード実行

Root TEEがPythonのトレーニングループを実行し、Worker TEEにサブタスクを委譲する。オーケストレーションにはTensorFlow Federatedから派生したオープンソースのFederated Languageを使用。外部に公開されるのはDPが適用されたモデルの重みのみとされている。

4. 耐障害性リカバリ

各ラウンド終了時にKMSで暗号化されたリカバリ状態を保存し、Root TEEやWorker TEEで障害が発生した場合にも対応できる設計が採用されている。

プライバシー保証が外部検証可能な理由

アクセスポリシーはSigstoreの公開透明性ログであるRekorに公開される。これにより外部監査者は、デバイスデータがどのサーバーワークロードに渡りうるかを追跡できる。KMSおよびデータ処理バイナリはオープンソースのコードから再現可能(Reproducible Build)とされており、独立した検証を可能にしている。

プロプライエタリなモデルアーキテクチャを保護するため、TEEはシリアル化されたロジックをランタイムにサイドロードする仕組みも備えているが、プライバシーに関わるロジックはすべて認証済みプログラムにハードコードされていなければならないとされている。ワークロードオペレーターが参照できるのはメトリクスとDPが適用されたモデルの重みのみで、アップロードされた暗号化データはアップロード後の限られた時間内にしか復号できない仕様だという。

Gboardへの適用と性能改善

Gboardはこのシステムを用いて、英語と日本語の次単語予測モデルを、より強力なプライバシー保証と改善された精度を伴う形でリリースしたと報告されている。

性能向上の背景として、2点の設計上の選択が挙げられている。

  • 一括収集とスケジュール最適化:サーバー側のトレーニング開始前にすべてのアップロードを収集することで、デバイスの参加率の時間的変動(昼夜差)による遅延を排除。最適な参加スケジュールの計算とDPパラメーターのチューニングが可能になったという。なお、プライバシーと精度のトレードオフ曲線は、6500デバイスのコホートで5000ラウンドのEnglishモデルトレーニングによって測定されたと記述されている。

  • ボトルネックの移行:従来は1〜2ヶ月かかっていたモデルのトレーニング時間が、サーバーサイドへの移行によって複数マシンへの並列化が可能になり、大幅に短縮されたとGoogleは報告している。ただし具体的な高速化の倍率は公表されていない。

まとめ

Googleの新システムは、連合学習におけるプライバシー保証の「信頼」を、事業者への盲目的な信頼から暗号学的・構造的な検証可能性へと転換しようとする試みとして注目される。TEEとSigstoreの透明性ログを組み合わせることで、外部監査者がプライバシー保護の実効性を独立して確認できる仕組みを整備した点が特徴的だ。GboardのEnglish・日本語モデルへの実際の適用を通じて、実用性も実証されたとされており、今後の動向が注目される。


出典: Google Research Moves Federated Learning Into TEEs: Gboard Now Trains With Externally Verifiable Differential Privacy