
何が起きたか
OpenAIは、聞きながら同時に話せる全二重音声モデルGPT-Live-1を、毎分0.05ドルのAPIとして開発者向けに提供開始。Yelpはすでに電話予約で利用している。
なぜ重要か
OpenAIのベンチマークで、全二重の対話性はGPT-Realtime-2.1の45.4%から80.1%に上昇し、ターン交代の遅延は1.4秒から0.8秒に短縮された。
注目点
毎分0.05ドルという価格が大量通話での導入を妨げないか、外部のテストがOpenAI自身のベンチマーク改善と一致するか。ツール呼び出し精度が60%から87%に向上した点にも注目だ。
誰に効くか音声エージェントを構築する開発者とコンタクトセンターのチームが最も明確な恩恵を受ける。全二重音声を異なるバックエンドモデルと組み合わせ、推論の深さ、速度、コストをトレードオフできるようになったからだ。電話ベースの顧客対応を検討する企業は、報告されている通話対応の改善に対して毎分0.05ドルのコストを正当化する必要がある。
こういう要約が、毎朝あなたのメールに届きます。
GPT-Live-1はまったく新しいモデルの投入というよりパッケージングの決断だ。この音声モデルはすでにChatGPT内で稼働しており、OpenAIは今それをAPIとして公開し、開発者が独自の音声アプリを構築できるようにした。開発者は音声レイヤーをタスクに応じて異なるバックエンドモデルと組み合わせられ、推論の深さ、速度、コストを用途ごとに合わせられる。
ベンチマークの話が売り文句だ。GPT-Realtime-2.1と比べて、OpenAIは全二重の対話性が45.4%から80.1%に跳ね上がり、ターン交代の遅延が1.4秒から0.8秒に下がり、ツール呼び出し精度が60%から87%に上がったと報告する。銀行の音声サポートのベンチマークでは、GPT-Live-1の合格率は12.4%から32%に達する。いずれもOpenAI自身の数字であり、外部の開発者が同じ改善を確認できるかが試される。
初期導入の例はYelpで、電話予約にこのモデルを使い、CTOのAlex Levy氏によれば通話対応が改善したという。音声エージェントを検討する企業にとって、結果はこうした運用上の改善が通話量における毎分0.05ドルを正当化できるか、また12種類の新音声と組み込みのASR文字起こし・応答テキストによって統合が導入しやすいものになるかにかかっていそうだ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した
100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する

Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した

Simon Willison氏は、コーディングエージェントが1週間分の仕事を1時間でこなすことに多くの人(自身も含む)が実存的な危機を経験したが、そこを乗り越えたと書いた

ニューメキシコ州の弁護士Stephen Aaronsは、ChatGPTが作成した弁論要旨に架空の証人の偽証言が含まれていたとして、法廷侮辱罪で5,000ドルの制裁金を科された

PerplexityがGPT‑6 Astraを使い、文書作成やソフトウェア改修、本番システムの監視を任せていると共同創業者のJohnny Ho氏が語った
