AIToday
大規模言語モデル音声・スピーチITmedia AI+掲載日時: 2026年10月2日 13:00

Microsoft AI、初のストリーミング文字起こしモデル発表

LINEで送る
Microsoft AI、初のストリーミング文字起こしモデル発表

3つのポイント

  1. 何が起きたか

    Microsoft AIはMAI-Transcribe-2-Streamingを公開。100ミリ秒強で暫定結果を返し、精度1位。60言語対応、音声1時間0.54ドル。

  2. なぜ重要か

    100ミリ秒強で結果を返すモデルなら、相手が話している間に音声エージェントが処理を始められる。Microsoftはこれを狙う音声エージェントの基盤とみている。

  3. 注目点

    精度1位はArtificial Analysisのストリーミング文字起こし評価によるもの。0.54ドルの時間単価は年末までの導入価格で、通常料金は変わる可能性が高い。

誰に効くか影響を受けるのは音声エージェントを開発する開発者やプロダクトチームで、音声1時間単位の低遅延な文字起こし選択肢を得る。また音声複製にアクセス承認と話者の同意を求める必要がある企業にも及ぶ。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

よくある質問
Microsoftのストリーミング文字起こしモデルの料金は?
MAI-Transcribe-2-Streamingは音声1時間あたり0.54ドルで、年末までの導入価格。通常料金は示されていない。
Microsoftの新しい音声モデルは声を複製できる?
はい、Voiceモデルはどちらも数秒の参照音声から声を複製できる。利用には審査とアクセス承認が必要で、本人の同意を得た声だけを合成する。
Microsoftの新しい音声モデルは日本語に対応?
発表で公開されたデフォルト音声リストに日本語はまだない。ただし提供リージョンにJapan Eastが含まれ、ストリーミング文字起こしモデルは60言語の一つとして日本語に対応する。
ITmedia AI+元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へMicrosoft、文字起こしAI首位投入