
何が起きたか
GoogleはGemini 3.8 Flash TTSとFlash-Lite TTSをGemini APIとGoogle AI Studioで展開。
なぜ重要か
Flash TTSはゲームキャラクターやオーディオブック、ポッドキャストなど創作向け。Flash-Lite TTSは吹き替えや音声コンテンツ、音声エージェント向けの低コスト大量音声生成が狙い。
注目点
新モデルのリージョナルエンドポイントは未公表。音色やピッチ、テンポ、アクセントを調整できるVoice Remixingもまだ利用できない。
誰に効くか音声エージェントや吹き替えパイプライン、オーディオブック、ゲームキャラクターを手がける開発者やプロダクトチームは、Gemini APIを通じてテキストプロンプトや30秒のサンプルから音声を設計できるようになる。ただしこれらのモデルにEUデータ処理のエンドポイントはまだ公表されていない。
こういう要約が、毎朝あなたのメールに届きます。
Googleの音声生成事業は、新モデルを利用者層で分けている。Gemini 3.8 Flash TTSはゲームキャラクターやオーディオブック、ポッドキャストなど創作向け。Gemini 3.8 Flash-Lite TTSは吹き替えや音声コンテンツ、音声エージェント向けの低コスト大量音声生成が狙いだ。両モデルはGemini APIとGoogle AI Studioを通じて展開される。Flash TTSはGemini Notebookにも登場し、Flash-Lite TTSはGoogle Vidsで利用可能。Gemini Enterprise API経由のアクセスも今後予定されている。
安全性の面では、Googleは音声をクローンされる本人が同意の口述を録音することを求めており、その録音の声は30秒のサンプルと一致しなければならない。生成されたすべてのクリップには不可聴のSynthID透かしも入る。AgoraやLiveKit、Pipecat、Vercelなどの開発者プラットフォームはすでにGemini API経由の統合に対応しているが、従来のTTSモデルがEUデータ処理を提供していたにもかかわらず、Googleは新モデルのリージョナルエンドポイントをまだ公表していない。
試金石となるのは、Googleが約束した音声品質を大規模に提供できるかどうかだ。スタイルプロンプト付きのプリセット音声を試したところ、説得力のあるドイツ語なまりが再現された一方、高音の背景ノイズが生じ、あるクリップでは最後に声が変わった。要求の厳しい制作現場に投入するには、まだ改良が必要かもしれない。Googleは無料枠のデータは製品改善に使うが有料枠のデータは使わないとしており、コストとデータ管理を天秤にかける企業にとっては重要な点だ。さらに2027年1月1日にはFlash TTSの出力1時間あたりの料金が0.81ドルから1.62ドルに引き上げられる予定で、大量利用者の長期的なコスト計画にも影響しうる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Googleはクラウド基盤でGemini 3.8 Flash TTSとFlash-Lite TTSを提供開始
Netflixは1971年の映画を基にしたリアリティー競技番組『Wonka's the Golden Ticket』を水曜日に初公開

Googleはgemini-3.8-flash-ttsとgemini-3.8-flash-lite-ttsを公開

ChatGPT VoiceがOpenAIの新モデルGPT-6 Astra、Sol、Lunaで動作

YouTubeは「Made On YouTube」で、YouTube Musicの「Ask Music」と毎週AI生成の「Your Podcast Lineup」を発表した

NVIDIAが1億パラメータモデルNemotron 3 Diarizationを公開
