
OpenAIがGPT TranscribeとGPT Live Transcribeという音声認識モデルをリリースし、単語誤り率3.31%を達成—先代比0.7ポイント改善—し、価格を25%削減して1分当たり0.0045ドルにした。ただしこれらのモデルはAA-WERベンチマークで4位にとどまり、ElevenLabs、Google、Mistralに後塵を拝しており、Mistralの1分当たり0.003ドルという直接的な価格競争に直面している。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
OpenAIがAPI経由で音声認識モデルGPT TranscribeとGPT Live Transcribeを公開した。GPT Transcribeは事前録音音声をリアルタイムの約34倍の速度で処理し、GPT Live Transcribeはリアルタイムストリーミングを低遅延で処理する。新型GPT Transcribeの単語誤り率は3.31%で、GPT-4o Transcribeから0.7ポイント改善し、価格は25%削減されて1分当たり0.0045ドルとなった。
なぜ重要か
OpenAIの音声認識モデルはAA-WERベンチマークで4位にランクインし、ElevenLabs Scribe v2(2.3%)、GoogleのGemini 3 Pro(2.9%)、MistralのVoxtral Small(3%)に次ぐ。価格引き下げにより、Mistral Voxtral Transcribe V2の1分当たり0.003ドルと競合する立場になり、競争の激しい音声認識市場での利益率の圧力にOpenAIが対応している可能性を示唆している。
注目点
これらのモデルはテキストを音声認識のコンテキスト、キーワードとして受け付け、複数の入力言語に対応しており、最近発表されたRealtime モデル生成(GPT-Realtime-Whisperを含む)を補完する。詳細な技術情報はOpenAIの音声認識ガイドで利用できる。
OpenAIはAPI経由で2つの新しい音声認識モデル、事前録音音声向けのGPT Transcribeとリアルタイムストリーミング向けのGPT Live Transcribeを導入した。GPT Transcribeはリアルタイムの約34倍の速度でオーディオを処理し、バッチワークロードに効率的である。GPT Live Transcribeはライブアプリケーション向けに低遅延のリアルタイムパフォーマンスを優先する。
Artificial Analysisが保有するAA-WERベンチマークに従い、GPT Transcribeは3.31%の単語誤り率を達成する。これは1年前の前世代モデルGPT-4o Transcribeと比較して0.7ポイント改善している。モデルリリースと同時にOpenAIは価格を25%引き下げ、音声1分当たり0.0045ドルとした。両モデルともテキストを音声認識のコンテキスト、キーワードとして受け付け、複数の入力言語をサポートしている。
競争環境では、OpenAIの音声認識モデルはAA-WERベンチマークで4位にランクインしている。ElevenLabs Scribe v2が2.3%の誤り率でリードし、GoogleのGemini 3 Proが2.9%、MistralのVoxtral Smallが3%で続く。Mistralは最近Voxtral Transcribe V2を1分当たり0.003ドルで導入し、OpenAIの新価格を下回ることで市場に圧力をかけている。これらの新しい音声認識モデルは、リアルタイム音声認識モデルGPT-Realtime-Whisperも含む、最近発表されたRealtime モデル生成を補完する。詳細な技術情報はOpenAIの音声認識ガイドで利用できる。
OpenAIによるGPT TranscribeとGPT Live Transcribeのリリースは、音声認識機能における段階的だが意味のある改善を示している。単語誤り率0.7ポイント削減と25%の価格引き下げは、ElevenLabs、Google、Mistralがより強いベンチマークを確立している市場での競争力維持の努力を示唆している。ElevenLabs Scribe v2がAA-WERランキングで2.3%でリードしており、GoogleのGemini 3 Pro(2.9%)とMistralのVoxtral Small(3%)の両者がOpenAIの提供を上回っている。より注目すべきは、MistralがOpenAIの0.0045ドルの価格ポイントを下回る1分当たり0.003ドルへの最近の転換がOpenAI自身の価格調整を促したと思われることだ。これらのモデルがテキストコンテキスト、キーワード、複数の入力言語をサポートすることは、柔軟なツールとしてのポジションを確立し、最近発表されたRealtime モデル生成(GPT-Realtime-Whisperを含む)との統合は、同社がより広いリアルタイムAI機能に音声認識をバンドルしていることを示唆している。適度な精度向上と積極的な価格設定の組み合わせがより高速な競合との差を埋められるかどうかは、今後を見守る必要がある。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます