AIToday
音声・スピーチTHE DECODER掲載日時: 2026年9月6日 19:013分で読める

メタがリアルタイム音声モデル公開

LINEで送る
メタがリアルタイム音声モデル公開

3つのポイント

  1. 何が起きたか

    メタのSuperintelligence Labsが、リアルタイム音声認識モデル「Muse Voice Transcribe」を公開した。生の会話中に音声を文字起こしし、話者の識別や文の境界の検出を行う。Meta Model APIを通じて利用でき、Meta AIとMuse Codeの音声入力機能を支える。

  2. なぜ重要か

    このモデルは競合より価格が安く、1時間あたり0.18ドル(音声1,000分あたり3ドル)。独立したテストでは英語の単語誤り率が3.1%で、ElevenLabs Scribe v2 Realtimeの3.6%、AssemblyAIの4.0%を下回る。20人以上の話者を識別でき、1時間を超える録音も後処理なしで対応する。

  3. 注目点

    精度と速度のバランスを調整する適応的遅延機構が、実際の使用環境で信頼できるかが成功の鍵を握る。5月にGPT-Realtime-Whisperを公開したOpenAIなど競合が価格でどう反応するかも注視される。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

メタによるMuse Voice Transcribeの公開は、2025年半ばのSuperintelligence Labsへの再編を経て、リアルタイム音声認識分野への参入を意味する。このモデルの適応的遅延機構は、単語ごとに聞き取り時間を決める方式で、精度と速度の両立を狙った技術的アプローチであり、強化学習で両者の最適化を図っている。これによりメタは、これまでのMuse Sparkシリーズと同様に、単純な性能よりも価格競争力を軸に勝負をかける姿勢だ。

Artificial Analysisによる独立評価で3.1%の誤り率を示したことは、ElevenLabsやAssemblyAIといった既存勢と互角以上でありながら、コストでは下回ることを示している。7月にOpenAIが文字起こし価格を引き下げていることもあり、競合他社の価格調整を迫る可能性がある。一方で、メタが重み付けの公開や学習詳細の開示を見送ったことで、オープンなモデルを好む開発者の導入が進まないリスクもある。

この取り組みの先には、ザッカーバーグが掲げる「パーソナル・スーパーインテリジェンス」の構想がある。信頼性の高い音声認識が、メガネ型端末を通じて聞き取るAIエージェントの基盤となるからだ。ただ、ドイツでメタのカメラ付きメガネの禁止が議論されるなど、規制面の壁が構想の足かせになる可能性もある。このモデルが成功するかは、価格優位性と精度で開発者を惹きつけられるかどうかにかかっており、クローズドソースという制約を乗り越えられるかが焦点となる。

よくある質問
Muse Voice Transcribeの料金は?
1時間あたり0.18ドル、または音声1,000分あたり3ドル。Cartesia Ink-2の4ドルやElevenLabs Scribe v2 Realtimeの6.50ドルより安い。
Muse Voice Transcribeはどの言語に対応している?
70以上の言語で学習し、25言語を詳細にテスト。文の途中で2言語を切り替えるコードスイッチングにも対応する。
精度は競合と比べてどう?
独立したテストで英語の単語誤り率は3.1%で、ElevenLabs Scribe v2 Realtimeの3.6%やAssemblyAIの4.0%を下回る。
LINEで送る

「音声・スピーチ」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Gemini向け音楽生成モデルLyria 3.5公開THE DECODER · 1日前
  • AWSがWhatsApp注文AIアシスタントを発表Amazon AI Blog · 2日前
  • 東急建設、音声AIで安全点検2027年までに展開Top Companies AI · 2日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAI食品広告に批判、店側は「一時的」