AIToday
大規模言語モデル音声・スピーチSiliconANGLE AI掲載日時: 2026年9月24日 10:01

GoogleのGemini 3.8 Flash TTS、Hume AIベンチマークで首位

LINEで送る
GoogleのGemini 3.8 Flash TTS、Hume AIベンチマークで首位

3つのポイント

  1. 何が起きたか

    Googleはクラウド基盤でGemini 3.8 Flash TTSとFlash-Lite TTSを提供開始。Flash TTSは130言語、Flash-Lite TTSは101言語に対応。

  2. なぜ重要か

    開発者は2,000種超の既製ボイスと30秒のサンプルからのカスタム音声作成を使い、オーディオブックなどの音声製品を構築できる。参入障壁の低下が期待される。

  3. 注目点

    Flash TTSは音質が高い分だけ価格も高い。購入者がこのトレードオフを受け入れるかが試金石だ。既製ボイスを改変する第3のカスタマイズ手段が追加されるかも注目される。

誰に効くかオーディオブックや動画ナレーションなど音声機能を手がけるアプリ開発者やコンテンツ制作者は、言語対応と価格帯が異なる2つの選択肢を得る。広範な導入は、Flash TTSの高い価格と優れた品質を購入者がどう評価するかにかかっている。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Googleの新しい音声合成モデルは、同社がすでに投入してきた音声処理ツール群の一環として登場した。音声エージェントや文字起こし、翻訳に最適化したアルゴリズムも含まれる。この経緯から、単一製品ではなくスイートを構築していることがうかがえ、新しい2モデルはAPIが非常によく似ているため、開発者は並行して使い分けられる。

注目すべきはカスタマイズ性だ。2,000種を超える既製ボイスのライブラリに加え、開発者は自然言語プロンプトか30秒の音声サンプルでカスタム音声を作成できる。複製を生成する前に話者の同意を得ることがGoogleから求められている。さらにGoogleは既製ボイスを改変する第3の選択肢も計画しており、AI話者の音色やアクセント、話す速さをどこまで制御できるかが広がる。

Hume AIのベンチマークで高い評価を得たことは、音質とコストを天秤にかける開発者の獲得に役立つ可能性がある。ただしFlash TTSは価格が高く、言語対応もFlash-Liteの101言語より狭いため、オーディオブックなど特定の用途で企業がどちらを選ぶかに影響しそうだ。

よくある質問
新しいGoogleのTTSモデル2種はどう違うのか?
Flash TTSは130言語に対応し、価格は高いが音質に優れる。Flash-Lite TTSは101言語に対応し、コスト効率と推論速度を重視して最適化されている。
これらのモデルで開発者はどうカスタム音声を作れるのか?
自然言語プロンプトを使うか、話者の同意を得た上で30秒の音声サンプルから音声を生成できる。Googleは既製ボイスを改変する第3の選択肢も計画している。
GoogleはAI生成音声の悪用をどう防ぐのか?
人間には聞こえないがAIツールで検出できるSynthID音声ウォーターマークを埋め込み、生成したすべての音声ファイルにC2PA記録を付与する。
SiliconANGLE AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Copilotアプリにワークフローキャンバス追加GitHub Copilot Blog · 2時間前
  • AstraとClaude Opus 5がエニグマ解読TechCrunch AI · 2時間前
  • MetaのMuse、ChatGPT初期を上回る勢いかTechCrunch AI · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へCopilot案件、5件から65件へ13倍増