
何が起きたか
OpenAIがAPIでGPT‑Live‑1を公開。聞くことと話すことを同時にこなす単一モデルで、フロントエンド音声層の価格は毎分0.05ドル。指示追従性が向上し、カスタム音声や電話対応もサポートする。
なぜ重要か
遅延を生み途切れに弱いSTT―LLM―TTSの連結構成を置き換える。
注目点
開発者が電話対応やカスタマーサポートで単一モデル方式を採用するかが試金石。カスタム音声の利用には営業への問い合わせが必要だ。
誰に効くか電話対応やカスタマーサポート向けの音声エージェントを開発する事業者は、より簡素なアーキテクチャと低遅延を得られる。OpenAI Presenceを利用する企業は、質問への回答や問題解決などのタスクにこうしたエージェントを導入できる。
こういう要約が、毎朝あなたのメールに届きます。
GPT‑Live‑1はまずChatGPTで導入され、今回APIでも利用可能になった。開発者は、聞くことと話すことを同時に行う音声モデルを利用できるようになる。今回の公開では、割り込み処理や推論・ツール呼び出しの委譲、システムプロンプトによる口調・ペース・スタイルの制御など、ユーザーやワークフローに合わせて音声体験を設計するための機能に重点が置かれている。長時間セッションの信頼性も高まり、背景ノイズや無音があっても会話を途切れさせない。
このモデルは、音声認識と推論モデル、音声合成をつなぎ合わせる従来構成を置き換え、音声エージェントのアーキテクチャを簡素化する。従来構成では受け渡しのたびに遅延が生じ、タイミングや文脈、会話のリズムを失う余地があった。GPT‑Live‑1は聞くことと話すことを単一モデルで処理し、割り込みや相づちにも即座に対応しながら、より深い推論はバックエンドに委譲する。開発者は会話の背後にあるモデル、ツール、エージェントハーネスを選び、タスクごとに推論の深さ、速度、コストを合わせられる。
成果を左右するのは、開発者が電話対応やカスタマーサポートで単一モデル方式を採用するか、カスタム音声へのアクセスが広く利用可能になるかだ。OpenAIは今後数カ月で音声の選択肢と言語対応を広げるとしている。これが、企業が自社製品に合い、ユーザーにとって自然に聞こえる音声エージェントをどれだけ早く導入できるかを決める可能性がある。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Metaが今週、AIアシスタント「Muse」を発表

ファナックは9月11日、アーク溶接用のAIエージェントを開発したと発表

独立系の検証で、逐次ステップ数はAstraが連鎖的思考なしに長い多段階タスクを完了できるかの予測には乏しいことが判明

フィールズ賞受賞の数学者25人が公開書簡に署名し、AIラボが未検証の証明を出し帰属にも疑問があると主張した

Bloombergは、Moonshot AIが今年末までに年間換算20億ドルの売上を目標としていると報じた

Google CloudとAvidは2026年9月11日、Gemini Enterpriseをブラウザ版Avid Media Composerに直接組み込んだと発表
