AIToday
大規模言語モデル音声・スピーチTHE DECODER掲載日時: 2026年10月2日 19:01

Microsoft音声AI、精度首位で100ms遅延

LINEで送る
Microsoft音声AI、精度首位で100ms遅延

3つのポイント

  1. 何が起きたか

    Microsoft AIがMAI-Transcribe-2-Streamingを発表。Artificial Analysisで首位、60言語対応、中間結果を100ミリ秒強で返す。

  2. なぜ重要か

    100ミリ秒未満の中間結果により、相手が話し終える前に音声エージェントが応答できる。自動電話やチャットエージェントが生の会話のように感じられる可能性がある。

  3. 注目点

    低遅延と音声クローンが実運用で通用するか。両音声モデルは数秒の音声から声を複製でき、安全策が組み込まれている。あるテストでは、4,000人の参加者の約半数が声を実在の人物のものだと思った。

誰に効くか音声エージェントを構築する企業や開発者——顧客対応の電話システム、音声アシスタント、コールセンター自動化——は、より低い遅延と価格を利用できる。機密性の高い通話を扱うチームは、Microsoftが組み込まれていると説明する音声クローンと不正利用の安全策を天秤にかける必要がある。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

よくある質問
開発者は新しいMicrosoftの音声モデルをどこで使えますか?
Microsoft FoundryやMAI Playgroundなどのプラットフォームで利用でき、2つの音声モデルはOpenRouterでも提供されている。
文字起こしモデルの料金はいくらですか?
年内は導入価格で音声1時間あたり0.54ドル。
新しいモデルは何言語に対応しますか?
MAI-Transcribe-2-Streamingは60言語を文字起こしし、MAI-Voice-2.1は同じ声で23言語をそれぞれのネイティブなアクセントで話すよう設計されている。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へNTT AI-CIX、分荷自動化AI開始