AI
Google DeepMind、740Mパラメータのマルチモーダル埋め込みモデル「EmbeddingGemma 2」をApache 2.0で公開
2026/10/07
Google DeepMind、マルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開
Google DeepMindは、オープンなマルチモーダル埋め込みモデル EmbeddingGemma 2 を公開した。Gemma 4アーキテクチャをベースに構築されており、テキスト・コード・画像・動画・音声という5種類の入力を、768次元の単一ベクトル空間にマッピングする。パラメータ数は740M、コンテキストウィンドウは8,192トークン(前バージョン比4倍)で、Apache 2.0ライセンスのもと提供される。
重みはHugging FaceおよびKaggleで即日公開されており、Ollama、llama.cpp(GGUF形式)、LiteRT向けビルドも利用可能だと報告されている。
モジュラー設計:必要なエンコーダだけロード可能
モデルの設計は3つのコンポーネントで構成されており、開発者は用途に応じて必要なモジュールのみをロードできる。
- テキスト・コードバックボーン:270M(トランスフォーマー130M+エンベッダー140M)
- ビジョンエンコーダ:170M(オプション)
- オーディオエンコーダ:300M(オプション)
これにより、テキストのみなら270M、テキスト+ビジョンなら440M、テキスト+音声なら570M、フルモデルで740Mという柔軟な構成が可能だ。すべての構成が同一のベクトル空間を共有するため、テキストのみで生成した埋め込みとフルモデルで生成した埋め込みをそのまま比較・検索できるという点が特徴的だ。
8,192トークンのコンテキストウィンドウは、画像換算で約29枚、動画フレームで約58枚、音声で約5.5分に相当すると報告されている。
ベンチマーク結果
Googleの研究チームは、1B未満のマルチモーダル埋め込みモデルの中でMTEB CodeおよびMAEBにおいてトップクラスのスコアを達成したと報告している。公開されたモデルカードによれば、768次元のフル精度での主要ベンチマーク結果は以下の通りだ。
| ベンチマーク | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite(画像) | 64.64 | n/a |
| MMEB v2 overall | 59.01 | n/a |
| MSEB retrieval(音声) | 69.54 | n/a |
| MAEB(音声) | 49.39 | n/a |
コード検索スコアは前バージョンから約9.92ポイント(約14%)向上している。一方、多言語テキストの品質は前バージョンとほぼ同水準を維持している。
なお、比較対象となりうる Qwen3-VL-Embedding-2B はMMEB-V2において73.2を報告しているが、パラメータ数は約2.7倍であり、音声サポートはないと記事は指摘している。
オンデバイス向けの軽量設計
EmbeddingGemma 2はモバイル・ラップトップでの動作を想定した設計がなされている。Google AI EdgeチームによるPixel 11 Proでの計測では、量子化後のアクティブRAM使用量はテキストのみで約191MB、フルマルチモーダルモデルで約567MBと報告されている。重みはINT4およびINT8へ量子化aware trainingにより圧縮されており、MacBook M5 Pro GPUでは70トークンのビジョンバジェットを使用した場合、1画像あたり37.3msという処理速度が確認されたという。
Matryoshka表現学習による次元削減
Matryoshka Representation Learning(MRL)により、ベクトルを768次元から512・256・128次元に切り詰めることが可能だ。768次元から128次元への変換でストレージを最大6倍削減できるとされている。モデルカードによれば、256次元ではMTEB多言語スコアが61.36から60.41への微減にとどまるが、128次元ではMMEBが45.65に低下するため、Googleは128次元をテキストのみの用途に推奨している。
主なユースケースと配布
Google DeepMindは、オンデバイス検索・分類・プライバシーファーストなRAGパイプラインを主なターゲットとして挙げている。ローカルで埋め込みを生成することで、データをデバイス外に送信せずに済み、レイテンシの削減やオフライン動作も実現できるとしている。
重みはHugging Face(google/embeddinggemma-2)、Kaggle、Ollamaで公開中であり、Apache 2.0ライセンスのもとで商用利用も可能だ。
出典: Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4