AIToday
音声・スピーチITmedia AI+掲載日時: 2026年9月2日 16:002分で読める

Meta、新音声認識モデル公開

LINEで送る
Meta、新音声認識モデル公開

要点

  • Metaがリアルタイム音声認識モデルMuse Voice Transcribeを公開した。

  • 20人以上の話者と1時間超の音声に対応する。

  • ストリーミング認識と話者分離で首位、誤り率は3.1%。

3つのポイント

  1. 何が起きたか

    Metaは、Meta Superintelligence Labs(MSL)が開発した初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。9月1日からMeta Model APIで提供され、料金は1時間あたり0.18ドル。

  2. なぜ重要か

    このモデルは20人以上の話者を識別でき、1時間を超える音声も後処理なしで処理。ストリーミング認識、話者分離、エンドポイント検出を単一モデルで実現する。70以上の言語で訓練され、日本語を含む25言語がリリース時に検証済みで、コードスイッチングにもネイティブ対応。

  3. 注目点

    Metaは、Artificial Analysisのストリーミング音声認識と公開話者分離ベンチマークで1位を主張。最終文字起こしの単語誤り率は3.1%、発話終了から0.16秒の遅延で、Cartesia Ink-2(3.4%)やElevenLabsのScribe v2 Realtime(3.6%)を上回る。Mac版Meta AIとMuse Codeにも音声入力機能として統合されている。

この記事についてAIに質問する →

背景と解説

Muse Voice Transcribeは、Metaが従来別々のシステムで処理されてきたタスクを統合したオールインワンモデルで、リアルタイム音声認識市場に参入することを示す。技術的には80ミリ秒の音声チャンクと適応的遅延学習を用いて精度と遅延のバランスを取っており、実用的なアプローチだ。CartesiaやElevenLabsなどの競合との比較で低い誤り率を示すMetaの位置づけは、品質重視を印象づける。ただし、モデルはオープンソース化されておらず、APIとMeta自社アプリのみで提供されるため、開発者の採用経路は異なる可能性がある。Mac版Meta AIとMuse Codeへの統合は、この技術を自社製品に組み込む意図を示している。今後、言語対応の拡大やオープンウェイトの公開が行われる可能性はあるが、現時点で明言はされていない。

よくある質問

Muse Voice TranscribeをAPIで使う場合の価格は?
Meta Model APIでの料金は1時間あたり0.18ドルです。
リリース時に対応している言語は?
70以上の言語で訓練され、初期リリースでは日本語を含む25言語が検証されています。
Muse Voice Transcribeを自分のアプリで使える?
はい、Meta Model APIを通じて開発者が利用でき、Mac版Meta AIとMuse Codeにも音声入力として統合されています。
ITmedia AI+元記事を読む
LINEで送る

「音声・スピーチ」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • ウィナンプ、AI音楽訴訟拡大 6社追加Yahoo Finance AI · 2時間前
  • Geminiアプリ月間10億人突破Google AI Blog · 12時間前
  • 三菱電機、汎用音分離AIを開発Top Companies AI · 1日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へウィナンプ、AI音楽訴訟拡大 6社追加