AI
Google、プロンプトで声を設計できる「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を公開
2026/09/26
Googleが新世代の音声合成モデルを公開
Googleは2026年9月23日、テキスト読み上げ(TTS)モデルの新シリーズとして 「Gemini 3.8 Flash TTS」 と 「Gemini 3.8 Flash-Lite TTS」 を発表した。同社はこれらを「これまでで最も表現豊かな音声生成モデル」と位置づけており、Gemini APIおよびGoogle AI Studioを通じて順次提供されている。なお、セルフホスティング向けのオープンウェイト公開は行われていない。エンタープライズ向けのAPIアクセスは近日提供予定とされている。
2つのモデルとその役割
リリースはユースケースの異なる2段階構成になっている。
-
Gemini 3.8 Flash TTS:ゲーム、没入感のあるオーディオブック、ポッドキャスト、インタラクティブメディアといったクリエイティブ用途を主なターゲットとする。演技キュー、ペーシング、方言の切り替え、バックチャネリングなどをきめ細かく制御できる。
-
Gemini 3.8 Flash-Lite TTS:大量処理とコスト効率を重視した設計で、吹き替え、音声コンテンツ制作、表現力のある音声エージェントへの活用を想定している。トーン、ペーシング、表現のニュアンスを細かく制御できる。
API上のモデル識別子はそれぞれ gemini-3.8-flash-tts と gemini-3.8-flash-lite-tts となっている。
プロンプトで声を「デザイン」する
従来のGemini TTSは30種類のプリセット音声を提供していたが、今回の3.8シリーズでは大幅に拡充された。
-
生成的な声のデザイン:役割、アクセント、声の特徴を記述したプロンプトから新しい音声を生成できる。100以上の言語・方言に対応しており、GoogleはメルボルンのラジオDJ、単調なロボット、日本語を話すドラゴンといったデモを公開している。
-
ボイスライブラリ:2,000種類以上のすぐに使える音声が提供される。メキシコのスペイン語、ケベックのフランス語、スコットランド英語といった地域バリアントもカバーされている。
-
カスタム音声の保存と再利用:作成した音声は保存でき、プロジェクト間でのずれ(ドリフト)を最小限に抑えながら再利用できるとされている。
-
音声リミックス(近日提供予定):ライブラリ内の音声の音色、ピッチ、速度、アクセントをプロンプトで調整できる機能が準備されている。
パフォーマンスの演出機能
両モデルとも、スクリプト内に舞台指示を記述する形式で細かな演出が可能だ。
-
長尺生成:数時間に及ぶ連続音声でも、声質・ペーシング・音色が一貫して保たれる。
-
2話者ステージング:1つのスクリプトで、区別された2つの声による複数ターンの会話を生成できる。
-
ボーカルバースト:
<laughs>、<sigh>、<gasp>といったタグで非言語的な表現を追加できる。 -
バックチャネリング:
|mhm|や|yeah|のような相槌表現で、リアクションのタイミングやコミカルな間を制御できる。
安全性への取り組みと音声複製
音声複製機能では、30秒の音声サンプルから一貫した声のプロフィールを構築できる。ただしサンプルは自分の声、または利用権を持つ声に限定されており、声の所有者による口頭での同意録音が必須とされている。
すべての生成音声には SynthID の透かしが埋め込まれる。この透かしは音声出力に直接、知覚できない形で埋め込まれるものだ。複製した音声にはC2PAコンテンツクレデンシャルも付与される。
ベンチマーク結果
Googleが報告しているベンチマーク結果は以下の通り。
- Hume AI Voice Design Benchmark:Flash TTSが総合スコア71.4で第1位
- アクセントモデリング:Flash TTSが60.8のスコアで首位
- Hume AI 総合品質インデックス:Flash TTSが第1位、Flash-Lite TTSが第2位
- Voice Arena ブラインド優先度評価:日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語のカテゴリで両モデルが上位を占めたと報告されている
なお、これらの結果はGoogle自身が報告したものであり、独立した第三者機関による検証とは区別する必要がある。
まとめ
Gemini 3.8 Flash TTSは、声をプロンプトで設計するという新たなアプローチで音声合成の自由度を大きく広げた。クリエイティブ用途向けのFlash TTSと、コスト重視のFlash-Lite TTSという2モデル構成により、用途に応じた使い分けが可能だ。現在はGemini APIおよびGoogle AI Studio経由でのみ利用でき、エンタープライズ向けAPIの提供も近日中に開始される予定だとされている。
出典: Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Design