AIToday
大規模言語モデル音声・スピーチTHE DECODER掲載日時: 2026年9月11日 4:002分で読める

OpenAI、音声API「GPT-Live-1」を公開

LINEで送る
OpenAI、音声API「GPT-Live-1」を公開

3つのポイント

  1. 何が起きたか

    OpenAIは、聞きながら同時に話せる全二重音声モデルGPT-Live-1を、毎分0.05ドルのAPIとして開発者向けに提供開始。Yelpはすでに電話予約で利用している。

  2. なぜ重要か

    OpenAIのベンチマークで、全二重の対話性はGPT-Realtime-2.1の45.4%から80.1%に上昇し、ターン交代の遅延は1.4秒から0.8秒に短縮された。

  3. 注目点

    毎分0.05ドルという価格が大量通話での導入を妨げないか、外部のテストがOpenAI自身のベンチマーク改善と一致するか。ツール呼び出し精度が60%から87%に向上した点にも注目だ。

誰に効くか音声エージェントを構築する開発者とコンタクトセンターのチームが最も明確な恩恵を受ける。全二重音声を異なるバックエンドモデルと組み合わせ、推論の深さ、速度、コストをトレードオフできるようになったからだ。電話ベースの顧客対応を検討する企業は、報告されている通話対応の改善に対して毎分0.05ドルのコストを正当化する必要がある。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

GPT-Live-1はまったく新しいモデルの投入というよりパッケージングの決断だ。この音声モデルはすでにChatGPT内で稼働しており、OpenAIは今それをAPIとして公開し、開発者が独自の音声アプリを構築できるようにした。開発者は音声レイヤーをタスクに応じて異なるバックエンドモデルと組み合わせられ、推論の深さ、速度、コストを用途ごとに合わせられる。

ベンチマークの話が売り文句だ。GPT-Realtime-2.1と比べて、OpenAIは全二重の対話性が45.4%から80.1%に跳ね上がり、ターン交代の遅延が1.4秒から0.8秒に下がり、ツール呼び出し精度が60%から87%に上がったと報告する。銀行の音声サポートのベンチマークでは、GPT-Live-1の合格率は12.4%から32%に達する。いずれもOpenAI自身の数字であり、外部の開発者が同じ改善を確認できるかが試される。

初期導入の例はYelpで、電話予約にこのモデルを使い、CTOのAlex Levy氏によれば通話対応が改善したという。音声エージェントを検討する企業にとって、結果はこうした運用上の改善が通話量における毎分0.05ドルを正当化できるか、また12種類の新音声と組み込みのASR文字起こし・応答テキストによって統合が導入しやすいものになるかにかかっていそうだ。

よくある質問
GPT-Live-1の利用料金はいくらか?
OpenAIはAPIを毎分0.05ドルで提供している。記事はこれが安くはないと指摘する。
GPT-Live-1は従来のOpenAI音声モデルにできなかった何ができるのか?
全二重であり、聞きながら同時に話せる。OpenAIのベンチマークではターン交代の遅延が1.4秒から0.8秒に短縮され、ツール呼び出し精度も60%から87%に向上した。
GPT-Live-1をすでに本番環境で使っている例はあるか?
Yelpが電話予約でこのモデルを使っている。CTOのAlex Levy氏は通話対応が改善したと報告している。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Dynatrace、Arize AIを買収SiliconANGLE AI · 4時間前
  • 100のファインチューニング、1GPUで1.5TBから19.3GBにDaily Dose of Data Science · 4時間前
  • OpenAIエージェントがRubyGems攻撃Simon Willison's Weblog · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

Dynatrace、Arize AIを買収

DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した

NEWSiliconANGLE AI4時間前

100のファインチューニング、1GPUで1.5TBから19.3GBに

100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する

NEWDaily Dose of Data Science4時間前

OpenAIエージェントがRubyGems攻撃

Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した

NEWSimon Willison's Weblog4時間前

Simon Willison氏、AIコーディングエージェントはソフトウェアエンジニアを終わらせないと語る

Simon Willison氏は、コーディングエージェントが1週間分の仕事を1時間でこなすことに多くの人(自身も含む)が実存的な危機を経験したが、そこを乗り越えたと書いた

NEWSimon Willison's Weblog4時間前

AI偽証言で弁護士侮辱罪

ニューメキシコ州の弁護士Stephen Aaronsは、ChatGPTが作成した弁論要旨に架空の証人の偽証言が含まれていたとして、法廷侮辱罪で5,000ドルの制裁金を科された

NEWArs Technica AI4時間前

Perplexity、GPT‑6 Astraに本番系を一任

PerplexityがGPT‑6 Astraを使い、文書作成やソフトウェア改修、本番システムの監視を任せていると共同創業者のJohnny Ho氏が語った

NEWOpenAI Blog4時間前
次の記事へCoxon氏の退社投稿、1億回超え