
何が起きたか
ElevenLabsが「Eleven v4」と「Eleven v4 Turbo」を公開。v4はArtificial Analysisの音声アリーナで首位、約75%が競合より好むと評価。
なぜ重要か
ElevenLabsによると、従来の音声合成は機械的な読み上げにとどまったが、Eleven v4は話者の感情や文脈を解釈して人間らしい音声を生成できるとされる。
注目点
首位評価はArtificial Analysisの限定的比較。Eleven v4 Turboの応答速度や多言語対応の具体性が焦点。
誰に効くか音声エージェントやオーディオブック、広告制作を手がける企業のクリエイティブ担当者や開発者が、より感情豊かで自然な音声を低遅延で利用できるようになる。特に多言語展開を進めるブランドやゲーム開発者にとって、声の一貫性維持がしやすくなるとみられる。
こういう要約が、毎朝あなたのメールに届きます。
ElevenLabsはこれまで、テキスト読み上げモデルの世代を重ねてきた。従来のモデルはテキストを読み上げることはできても、感情の深みや文脈に応じた抑揚の再現は限定的だった。Eleven v4はアーキテクチャを一新し、話者のトーンやペーシング、キャラクター性、文脈を解釈して音声を生成する点を特徴とする。
同社はEleven v4と低遅延版のEleven v4 Turboを同時に投入した。TurboはElevenAgentsと一体で最適化されており、他のエージェント開発者が異なるベンダーのモデルを組み合わせる場合と比べ、出力の調整や改善がしやすいとしている。多言語では90言語以上をサポートし、録音した声が別言語でもネイティブのアクセントを帯びつつ元の声のアイデンティティを保つ。
こうした性能が実際の制作現場でどこまで通用するかは、長時間のナレーションや対話生成での一貫性、感情表現の精度にかかっているとみられる。音声エージェントやダビング、オーディオブック制作に携わる事業者にとって、モデルの選択肢が広がる一方、用途ごとの最適な使い分けが今後の焦点となる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Modulateが2500万ドルを調達
Tarini Padmanabhuni氏創業のSan Francisco拠点DetectifAIは、スマホOS内で動く小型AIモデルで通話・音声メッセージ中のAI生成音声を端末外に音声を出さず即判定するSDKを携帯メーカ…

Googleは対話型音声モデルGemini 3.8 LiveにLive Avatar機能を搭載し、Gemini Enterpriseで利用可能になったと発表した

Googleが音声生成AI「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表

OpenAIは9月24日、ChatGPT Voiceが接続済みアプリやツールを使った作業に対応と発表

Nottaの「Notta Memo Pro」は、薄型ボディで素早く録音を開始でき、文字起こしと要約もこなすAIボイスレコーダー
