
何が起きたか
Metaは、Meta Superintelligence Labs(MSL)が開発した初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。9月1日からMeta Model APIで提供され、料金は1時間あたり0.18ドル。
なぜ重要か
このモデルは20人以上の話者を識別でき、1時間を超える音声も後処理なしで処理。ストリーミング認識、話者分離、エンドポイント検出を単一モデルで実現する。70以上の言語で訓練され、日本語を含む25言語がリリース時に検証済みで、コードスイッチングにもネイティブ対応。
注目点
Metaは、Artificial Analysisのストリーミング音声認識と公開話者分離ベンチマークで1位を主張。最終文字起こしの単語誤り率は3.1%、発話終了から0.16秒の遅延で、Cartesia Ink-2(3.4%)やElevenLabsのScribe v2 Realtime(3.6%)を上回る。Mac版Meta AIとMuse Codeにも音声入力機能として統合されている。
こういう要約が、毎朝あなたのメールに届きます。
Muse Voice Transcribeは、Metaが従来別々のシステムで処理されてきたタスクを統合したオールインワンモデルで、リアルタイム音声認識市場に参入することを示す。技術的には80ミリ秒の音声チャンクと適応的遅延学習を用いて精度と遅延のバランスを取っており、実用的なアプローチだ。CartesiaやElevenLabsなどの競合との比較で低い誤り率を示すMetaの位置づけは、品質重視を印象づける。ただし、モデルはオープンソース化されておらず、APIとMeta自社アプリのみで提供されるため、開発者の採用経路は異なる可能性がある。Mac版Meta AIとMuse Codeへの統合は、この技術を自社製品に組み込む意図を示している。今後、言語対応の拡大やオープンウェイトの公開が行われる可能性はあるが、現時点で明言はされていない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
GoogleはGeminiアプリとAPIで音楽生成モデルLyria 3.5を公開した

メタのSuperintelligence Labsが、リアルタイム音声認識モデル「Muse Voice Transcribe」を公開した

AWSは、Amazon Bedrock AgentCoreとAmazon Nova 2を使い、マルチモーダル対応のWhatsApp注文アシスタントを導入するソリューションを公開した

東急建設は2026年8月31日、NTTコノサーフの音声AIと生成AIを使いKY(危険予知)活動をデジタル化すると発表

ローランドは、音楽制作ソフト向けのプラグイン「Melody Flip」を発表した

マイクロソフトAIが音声認識モデル「MAI-Transcribe-2」を公開
