
何が起きたか
ElevenLabsがEleven v4とTurboを公開した。
なぜ重要か
応答の速さと表現力の両立により、顧客対応やゲームの音声エージェント開発者は従来の二択を避けられるとみられる。
注目点
10月12日までの値下げ価格(v4は22ドル、Turboは11ドル)が普及の試金石となる。通常価格はそれぞれ80ドルと40ドル。
誰に効くか音声エージェントや顧客対応システムを開発する企業のプロダクト担当者、ナレーションや吹き替えを制作する音声制作会社に影響する。低遅延化と多言語対応で、リアルタイム対話や多言語展開の選択肢が広がる可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
ElevenLabsは約1年前にリリースしたv3でオーディオタグによる感情や間の制御を既に可能にしていたが、指示への追従精度が課題だった。v4は新アーキテクチャで脚本のトーン、ペース、文脈を分析し、タグや平文の指示、発音の音声表記を通じてより正確に制御できるようにした。これにより、長編ナレーションやオーディオブック、対話シーンでも話者の一貫性が保たれやすくなる。
多言語対応はv3の約70言語から90言語以上に拡大し、クローン音声が他言語でも元のアクセントに引き戻されにくくなった。プロフェッショナル音声クローンはv3で未対応だったが再び利用可能となり、インスタント音声クローンは10秒の音声で作成できる。これらの改良は吹き替えや国際展開を狙う制作現場にとって実用的な進歩となる。
Turboはリアルタイム音声エージェント向けに、速度と表現力のトレードオフを解消することを狙う。ElevenLabsのテストでは150ミリ秒で発話を開始し、Cartesia Sonic 3.6の262ミリ秒やOpenAIのGPT-4o mini TTSの814ミリ秒を大きく下回る。また、Artificial AnalysisのProvider Voice ArenaリーダーボードでCartesia Sonic 3.6やGoogle Gemini 3.8 Flash TTSを上回り、発音ベンチマークでは91.7%を記録した。
ただし、これらの数値は主にElevenLabs自身のテストやブラインドテストに基づく。10月12日までの値下げや、Creatorプラン以上での2週間無償利用などの販促策が実際の採用を左右するかが焦点となる。音声エージェントやナレーション制作の現場では、低遅延と多言語一貫性が制作コストやユーザー体験にどう影響するかが注目される。
業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
東京地裁は津田健次郎がTikTokにAI音声クローン動画の削除を求めた申し立てを、既に削除済みとして棄却

DeepLがDeepL Voiceで音声から音声へのリアルタイム翻訳を正式提供

AHSが9月29日、Synthesizer V 2用の歌声データベース2製品を発売

NTT西日本のVOICENCEは2026年9月28日、無料の「声の相談窓口」を開設すると発表

AWSはvLLM-Omni Deep Learning Containerを使いAmazon SageMaker AI上にQwen3-TTSを展開するチュートリアル第1部を公開

Modulateが2500万ドルを調達