AIToday
大規模言語モデル音声・スピーチOpenAI Blog掲載日時: 2026年9月11日 4:002分で読める

GPT‑Live‑1がAPIで提供開始、毎分0.05ドル

LINEで送る
GPT‑Live‑1がAPIで提供開始、毎分0.05ドル

3つのポイント

  1. 何が起きたか

    OpenAIがAPIでGPT‑Live‑1を公開。聞くことと話すことを同時にこなす単一モデルで、フロントエンド音声層の価格は毎分0.05ドル。指示追従性が向上し、カスタム音声や電話対応もサポートする。

  2. なぜ重要か

    遅延を生み途切れに弱いSTT―LLM―TTSの連結構成を置き換える。

  3. 注目点

    開発者が電話対応やカスタマーサポートで単一モデル方式を採用するかが試金石。カスタム音声の利用には営業への問い合わせが必要だ。

誰に効くか電話対応やカスタマーサポート向けの音声エージェントを開発する事業者は、より簡素なアーキテクチャと低遅延を得られる。OpenAI Presenceを利用する企業は、質問への回答や問題解決などのタスクにこうしたエージェントを導入できる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

GPT‑Live‑1はまずChatGPTで導入され、今回APIでも利用可能になった。開発者は、聞くことと話すことを同時に行う音声モデルを利用できるようになる。今回の公開では、割り込み処理や推論・ツール呼び出しの委譲、システムプロンプトによる口調・ペース・スタイルの制御など、ユーザーやワークフローに合わせて音声体験を設計するための機能に重点が置かれている。長時間セッションの信頼性も高まり、背景ノイズや無音があっても会話を途切れさせない。

このモデルは、音声認識と推論モデル、音声合成をつなぎ合わせる従来構成を置き換え、音声エージェントのアーキテクチャを簡素化する。従来構成では受け渡しのたびに遅延が生じ、タイミングや文脈、会話のリズムを失う余地があった。GPT‑Live‑1は聞くことと話すことを単一モデルで処理し、割り込みや相づちにも即座に対応しながら、より深い推論はバックエンドに委譲する。開発者は会話の背後にあるモデル、ツール、エージェントハーネスを選び、タスクごとに推論の深さ、速度、コストを合わせられる。

成果を左右するのは、開発者が電話対応やカスタマーサポートで単一モデル方式を採用するか、カスタム音声へのアクセスが広く利用可能になるかだ。OpenAIは今後数カ月で音声の選択肢と言語対応を広げるとしている。これが、企業が自社製品に合い、ユーザーにとって自然に聞こえる音声エージェントをどれだけ早く導入できるかを決める可能性がある。

よくある質問
GPT‑Live‑1の利用料金はいくらか?
GPT‑Live‑1はAPIで利用でき、フロントエンド音声層の価格は毎分0.05ドル。
GPT‑Live‑1はどのモデルと組み合わせられるか?
GPT‑6 Astraのようなバックエンドのテキストモデルやサードパーティモデルと組み合わせられ、会話の背後で使うツールやエージェントハーネスも選べる。
GPT‑Live‑1は電話に対応するか?
はい。レストランの予約からカスタマーサポートまで、電話向けの全二重音声エージェントを導入できる。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • MetaのMuse AI、Amazonデータ取得Top Companies AI · 3時間前
  • ファナック、アーク溶接AIエージェント発表Top Companies AI · 3時間前
  • Astraの非CoT、制限は推測深度LessWrong AI · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAmazon、ChatGPTに広告開放