
Metaがリアルタイム音声認識モデルMuse Voice Transcribeを公開した。
20人以上の話者と1時間超の音声に対応する。
ストリーミング認識と話者分離で首位、誤り率は3.1%。
何が起きたか
Metaは、Meta Superintelligence Labs(MSL)が開発した初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。9月1日からMeta Model APIで提供され、料金は1時間あたり0.18ドル。
なぜ重要か
このモデルは20人以上の話者を識別でき、1時間を超える音声も後処理なしで処理。ストリーミング認識、話者分離、エンドポイント検出を単一モデルで実現する。70以上の言語で訓練され、日本語を含む25言語がリリース時に検証済みで、コードスイッチングにもネイティブ対応。
注目点
Metaは、Artificial Analysisのストリーミング音声認識と公開話者分離ベンチマークで1位を主張。最終文字起こしの単語誤り率は3.1%、発話終了から0.16秒の遅延で、Cartesia Ink-2(3.4%)やElevenLabsのScribe v2 Realtime(3.6%)を上回る。Mac版Meta AIとMuse Codeにも音声入力機能として統合されている。
Muse Voice Transcribeは、Metaが従来別々のシステムで処理されてきたタスクを統合したオールインワンモデルで、リアルタイム音声認識市場に参入することを示す。技術的には80ミリ秒の音声チャンクと適応的遅延学習を用いて精度と遅延のバランスを取っており、実用的なアプローチだ。CartesiaやElevenLabsなどの競合との比較で低い誤り率を示すMetaの位置づけは、品質重視を印象づける。ただし、モデルはオープンソース化されておらず、APIとMeta自社アプリのみで提供されるため、開発者の採用経路は異なる可能性がある。Mac版Meta AIとMuse Codeへの統合は、この技術を自社製品に組み込む意図を示している。今後、言語対応の拡大やオープンウェイトの公開が行われる可能性はあるが、現時点で明言はされていない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ウィナンプ・グループ傘下のJamendo SAは、NVIDIAに対する米連邦訴訟を修正し、正式な送達が完了した

Googleは8月、Gemini 3.7 Flash、Gemini 3.5 Transcribe、Pixel 11シリーズなどを発表した

三菱電機と米国子会社Mitsubishi Electric Research Laboratoriesは、テキストによる指示で混合音声から指定した音を分離・抽出できる単一のAIモデルを開発した

EDMプロデューサーのMax "H4RRIS" Harrisと、イタリアのターンテーブリストからプロデューサーに転身したNihil Youngが、EDMシーンにおけるAI生成音楽を公然と批判している

Beatportは、全体または大部分をAIで制作されたトラックを禁止した

消防庁は2027年度に119番通報のAI活用に関するモデル事業を始める計画だ
