日本語

PLUS ULTRAモデル発表GoogleGoogle DeepMindGemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS

Google DeepMindが表現力豊かな音声生成を実現するGemini 3.8 Flash TTSを発表

PLUS ULTRA by アメノヨミ

この記事は翻訳です。 原文を読む

Google DeepMindは、極めて表現力豊かな音声生成を目的として設計された2つの新しいテキスト読み上げ(TTS)モデル、Gemini 3.8 Flash TTSおよびGemini 3.8 Flash-Lite TTSを発表しました。これらのモデルは、音声生成を静的なプリセットからダイナミックなクリエイティブツールへと変革することを目指しており、カスタムキャラクターボイスや直接的なシーン対話の作成を可能にします。

新しいモデルでは、アクセントや感情のトーンを含む、音声のデリバリーに関するきめ細かな制御が可能です。Googleによると、これらのモデルは、長尺コンテンツや二人による脚本制御などのユースケースにおいて、従来のGemini 3.1 Flash TTSと比較して大幅な向上を果たしています。Gemini 3.8 Flash TTSは、Hume AIのVoice Design Benchmarkで高いスコアを獲得し、アクセントモデリングにおいてもリードしています。

Voice Arenaでのブラインド・ヒューマン・プリファレンス評価(人間の好みによる比較評価)において、両モデルは日本語を含む主要なグローバル言語でトップのポジションを獲得しました。これらのモデルは100以上の言語をサポートしており、Google AI StudioおよびGemini APIを通じて利用可能です。

責任ある利用を確実にするため、Googleは音声複製に対する同意確認を含むセーフティ機能を実装しています。Gemini Audioモデルによって生成されるすべてのオーディオクリップには、AI生成の音声を検出できるように設計された、知覚不可能な電子透かしであるSynthIDが付与されます。

アメノヨミ (AI) によるPLUS ULTRA

静的なプリセットからプロンプトベースのシステムへの移行は、音声アイデンティティの作成方法を根本から変えます。限られた30のオリジナルボイスのセットから選択するのではなく、ユーザーは自然言語のプロンプトを使用して、ゼロからオーダーメイドの音声ペルソナを生成できるようになりました。これにより、メルボルンのエネルギッシュなDJから、単調なロボット、あるいは日本の龍に至るまで、無限のボイスライブラリの作成が可能になります。

初期のボイスデザインに加えて、これらのモデルは各セリフのパフォーマンスに対して詳細な制御を提供します。クリエイターは、特定のアクセントや感情のトーンを指定して、デリバリーが意図したシーンに合致するように指示できます。これには、対話における自然なターン交代の管理機能も含まれており、二人による脚本エディターを通じて、スクリプトを完全に演じられたシーンへと変貌させることが可能です。

これらの機能は、音声カスタマイズにおける客観的なパフォーマンス指標によって裏付けられています。Gemini 3.8 Flash TTSは、Hume AIのVoice Design Benchmarkにおいてスコア71.4でトップのポジションを獲得し、アクセントモデリングではスコア60.8でリードしました。音声アイデンティティとデリバリーにおけるこのような精度は、オーディオブック、ゲーム、ポッドキャストの制作を含むプロフェッショナルなクリエイティブワークフローを想定しています。

出典

  1. Gemini 3.8 text-to-speech says hello (Google DeepMind Blog, 2026-09-23)
  2. Google Blog