米Googleは9月23日(現地時間)、テキストから音声を生成するTTS(Text-to-Speech)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。
モデル発表GoogleGemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
Google、自然言語でゼロから声を作れる「Gemini 3.8 Flash TTS」を発表
Flash TTSは、キャラクターの声作りや細かな演出の指示に向いたモデルで、ゲームやオーディオブック、ポッドキャストでの利用を想定している。一方、低価格なFlash-Lite TTSはコスト効率を重視しており、大量の吹き替えや音声エージェントなどの用途に向く。
新モデルの大きな特徴は、従来の既定音声から選ぶ形式に加え、自然言語による指示で新しい声をゼロから生成できる点だ。役柄やアクセント、声質などを指定して作成した声は保存が可能で、長期的なプロジェクトでも同じ声を使用できる。また、30秒の音声サンプルから声を再現する「ボイスレプリケーション」機能も備える。なお、レプリケーションの利用には、話者の口頭による同意と録音の提出が必要となる。
演技面では、1行ごとにト書きのような指示を記述することで、話すペースや感情、笑い声やため息といった非言語音、相づちなどの挿入を制御できる。生成された音声には、AI生成であることを検出するための電子透かし技術「SynthID」が埋め込まれる。
Flash TTSはGemini APIとGoogle AI Studioを通じて提供され、一般ユーザーはGemini Notebookで利用できる。Flash-Lite TTSも同様の経路に加え、一般ユーザー向けにはGoogle Vidsを通じて提供される。
出典
- ゼロから声を作れる音声生成モデル「Gemini 3.8 Flash TTS」公開 「Gemini Notebook」でも利用可能に (ITmedia AI+、2026-09-24)