TIP
← 記事

AI

Google、プロンプトで声を設計できる「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を公開

2026/09/26

Googleが新世代の音声合成モデルを公開

Googleは2026年9月23日、テキスト読み上げ(TTS)モデルの新シリーズとして 「Gemini 3.8 Flash TTS」 と 「Gemini 3.8 Flash-Lite TTS」 を発表した。同社はこれらを「これまでで最も表現豊かな音声生成モデル」と位置づけており、Gemini APIおよびGoogle AI Studioを通じて順次提供されている。なお、セルフホスティング向けのオープンウェイト公開は行われていない。エンタープライズ向けのAPIアクセスは近日提供予定とされている。

2つのモデルとその役割

リリースはユースケースの異なる2段階構成になっている。

  • Gemini 3.8 Flash TTS:ゲーム、没入感のあるオーディオブック、ポッドキャスト、インタラクティブメディアといったクリエイティブ用途を主なターゲットとする。演技キュー、ペーシング、方言の切り替え、バックチャネリングなどをきめ細かく制御できる。

  • Gemini 3.8 Flash-Lite TTS:大量処理とコスト効率を重視した設計で、吹き替え、音声コンテンツ制作、表現力のある音声エージェントへの活用を想定している。トーン、ペーシング、表現のニュアンスを細かく制御できる。

API上のモデル識別子はそれぞれ gemini-3.8-flash-tts と gemini-3.8-flash-lite-tts となっている。

プロンプトで声を「デザイン」する

従来のGemini TTSは30種類のプリセット音声を提供していたが、今回の3.8シリーズでは大幅に拡充された。

  • 生成的な声のデザイン:役割、アクセント、声の特徴を記述したプロンプトから新しい音声を生成できる。100以上の言語・方言に対応しており、GoogleはメルボルンのラジオDJ、単調なロボット、日本語を話すドラゴンといったデモを公開している。

  • ボイスライブラリ:2,000種類以上のすぐに使える音声が提供される。メキシコのスペイン語、ケベックのフランス語、スコットランド英語といった地域バリアントもカバーされている。

  • カスタム音声の保存と再利用:作成した音声は保存でき、プロジェクト間でのずれ(ドリフト)を最小限に抑えながら再利用できるとされている。

  • 音声リミックス(近日提供予定):ライブラリ内の音声の音色、ピッチ、速度、アクセントをプロンプトで調整できる機能が準備されている。

パフォーマンスの演出機能

両モデルとも、スクリプト内に舞台指示を記述する形式で細かな演出が可能だ。

  • 長尺生成:数時間に及ぶ連続音声でも、声質・ペーシング・音色が一貫して保たれる。

  • 2話者ステージング:1つのスクリプトで、区別された2つの声による複数ターンの会話を生成できる。

  • ボーカルバースト:<laughs>、<sigh>、<gasp> といったタグで非言語的な表現を追加できる。

  • バックチャネリング:|mhm| や |yeah| のような相槌表現で、リアクションのタイミングやコミカルな間を制御できる。

安全性への取り組みと音声複製

音声複製機能では、30秒の音声サンプルから一貫した声のプロフィールを構築できる。ただしサンプルは自分の声、または利用権を持つ声に限定されており、声の所有者による口頭での同意録音が必須とされている。

すべての生成音声には SynthID の透かしが埋め込まれる。この透かしは音声出力に直接、知覚できない形で埋め込まれるものだ。複製した音声にはC2PAコンテンツクレデンシャルも付与される。

ベンチマーク結果

Googleが報告しているベンチマーク結果は以下の通り。

  • Hume AI Voice Design Benchmark:Flash TTSが総合スコア71.4で第1位
  • アクセントモデリング:Flash TTSが60.8のスコアで首位
  • Hume AI 総合品質インデックス:Flash TTSが第1位、Flash-Lite TTSが第2位
  • Voice Arena ブラインド優先度評価:日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語のカテゴリで両モデルが上位を占めたと報告されている

なお、これらの結果はGoogle自身が報告したものであり、独立した第三者機関による検証とは区別する必要がある。

まとめ

Gemini 3.8 Flash TTSは、声をプロンプトで設計するという新たなアプローチで音声合成の自由度を大きく広げた。クリエイティブ用途向けのFlash TTSと、コスト重視のFlash-Lite TTSという2モデル構成により、用途に応じた使い分けが可能だ。現在はGemini APIおよびGoogle AI Studio経由でのみ利用でき、エンタープライズ向けAPIの提供も近日中に開始される予定だとされている。


出典: Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Design