Google DeepMind、音声生成モデル「Gemini 3.8 Flash TTS」公開

基本情報
| 項目 | 内容 |
|---|---|
| 公開元 | Google DeepMind |
| 公開日 | 2026-09-24 |
| 出典の種類 | 公開元の一次情報(Google DeepMind公式ブログが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Google DeepMindは、音声生成モデル「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」を新たに公開した。テキストからカスタムキャラクターの音声生成やシーンのダイアログ演出を行える音声合成モデルであり、Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsを通じて提供される。
スペック
- モデル構成: Gemini 3.8 Flash TTS、Gemini 3.8 Flash-Lite TTS
- 多言語対応: 100以上の言語や方言をサポート
- ボイスライブラリ: 2,000以上のプロダクション向け音声を提供
- 音声複製機能: 30秒の音声サンプルから一貫した音声プロファイルを再作成可能
- 安全性・検証機能: 同意検証、SynthIDウォーターマーク、C2PAクレデンシャルを統合
性能・品質
公開元であるGoogle DeepMindの発表によると、Gemini 3.8 Flash TTSはHume AIのVoice Design Benchmarkで全体1位(71.4)を獲得し、アクセントモデリング(60.8)でも首位となった。また、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSは、Hume AIのOverall Quality Indexにおいてそれぞれ1位と2位を獲得している。
さらに、Voice Arenaにおけるブラインドヒューマン選好評価では、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA)、メキシコスペイン語、ヒンディー語などの主要なグローバル言語で上位を獲得した。Gemini 3.1 Flash TTSと比較して、長尺コンテンツや2話者脚本の制御など幅広いユースケースで大幅な改善が見られると報告されている。
得意なこと・想定用途
Gemini 3.8 Flash TTSは、深いクリエイティブなディレクションとキャラクターデザインに特化したモデルである。自然言語のプロンプトを用いることで、ゼロから全く新しい声を設計し、ゲーム、没入型オーディオブック、ポッドキャスト、インタラクティブメディアなどの分野でキャラクターに命を吹き込むことができる。具体的には、演技の指示、ペース、方言の変化、そしてバックチャネリング(相槌)といった要素を、一行ごとに細かく制御することが可能だ。
対照的に、Gemini 3.8 Flash-Lite TTSは、大量の処理をコスト効率よく行うために最適化されている。大量の吹き替え作業やオーディオコンテンツの制作、さらにはトーンやペース、表現の細かなニュアンスを制御できる、表現力豊かな音声エージェントの構築といった用途に適している。
主な機能と特徴は以下の通りである。
- 生成的な音声デザイン: ロール、アクセント、声の特徴を自然言語で指定することで、100以上の言語や方言に対応した独自の声を設計できる。例えば、ドラマチックなドラゴンの声や、特定の地域特有の韻律を持つナレーターの声などを生成できる。
- ボイスライブラリと複製: 2,000以上のプロダクション向け音声にアクセスできるほか、30秒の音声サンプルから一貫した音声プロファイルを再作成する音声複製機能も備えている。なお、音声複製には、音声所有者による口頭での同意録音を用いた同意検証プロセスが組み込まれている。
- パフォーマンスの精密な演出: 台本上の指示(ステージディレクション)やスクリプトのキューを用いることで、落ち着いたカスタマーサービス担当者から、囁くようなサスペンスシーンまで、演技の質を自在にコントロールできる。
- 長尺コンテンツへの対応: 数時間に及ぶ連続した音声生成においても、話者の声質が変化(ドリフト)することなく、自然なペースと高い品質を維持できるため、ポッドキャストやオーディオブックの制作に最適である。
- 複数話者のシーン構成: 単一のスクリプトから、自然なターンテーキングを伴う2話者間の会話をシームレスに演出できる。
- 非言語的な質感の追加:
<laughs>、<sigh>、<gasp>といった音声のバーストや、|mhm|、|yeah|といった能動的なリスニングの相槌(バックチャネリング)をスクリプトに組み込むことで、リアルな会話の質感を演出できる。
また、近日中には、ライブラリ内の音声の音色、ピッチ、ペース、アクセントをプロンプトで微調整できる「ボイスリミックス」機能も導入される予定である。
入手方法
開発者は、Google AI Studio内の「オーディオ・プレイグラウンド」を通じて、これらの音声生成機能を体験することができる。このワークスペースでは、新しい音声アイデンティティをゼロからプロンプトで作成したり、自身の声を複製したりした後、2話者用の脚本エディタを使用して一行ずつの演出を試すことが可能だ。
各モデルの展開状況は以下の通りである。
Gemini 3.8 Flash TTS
– 開発者向け: Gemini API および Google AI Studio
– エンタープライズ向け: Gemini Enterprise を通じた API 提供が近日開始予定
– 一般ユーザー向け: Gemini Notebook
Gemini 3.8 Flash-Lite TTS
– 開発者向け: Gemini API および Google AI Studio
– エンタープライズ向け: Gemini Enterprise を通じた API 提供が近日開始予定
– 一般ユーザー向け: Google Vids

