AIToday
大規模言語モデル音声・スピーチTechCrunch AI掲載日時: 2026年10月12日 1:00

音声AI、ChatGPT的瞬間は未到達

LINEで送る
音声AI、ChatGPT的瞬間は未到達

3つのポイント

  1. 何が起きたか

    PolyAIのCTO Shawn Wen氏はHumanXカンファレンスで、全二重モデルはすでに存在するが、音声AIにはまだ「ChatGPTの瞬間」がないと語った。次のハードルは高速な推論だ。

  2. なぜ重要か

    Wen氏は、カスタマーサービスのAIエージェントはロボットのように聞こえるべきではなく、自信を与えるべきだと主張した。人は人間のエージェントは不要と感じるかもしれない。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

音声AIには数十億ドルの投資が集まり、モデル開発企業、企業向けカスタマーサービス、会議の議事録作成、AIによるディクテーションまでスタートアップが広がる。人間らしい会話をうたうリリースはほぼ毎週のように届き、それだけにPolyAIのCTOによる壇上での評価は際立つ。この技術は聞きながら話せる全二重モデルという一つの閾値を越えても、ChatGPTを誰もが知る存在にした画期的な瞬間はまだ生まれていない。

Wen氏は残る隔たりを音声の品質ではなく速度に見出す。音声が十分に良く、顧客が最初の2、3ターンやり取りする気になれば自信が高まり、エージェントが問題を解決できれば人間は不要と発信者が結論づけるかもしれないと述べる。その流れは推論の遅延を、単なるエンジニアリングではなくカスタマーサービス導入におけるビジネスの問題に変える。

同氏はサービスエージェントがロボットのように聞こえるべきではないとも主張した。この点はOtterのCMO Alex Gay氏が論じた透明性への期待と重なる。Gay氏は文字起こしの正確さを下流の自動化を支える層と表現し、両社が録音されていることやAIと話していることを人々に伝えることを重視していると指摘した。

よくある質問
Shawn Wen氏が音声AIの次の課題だと挙げたのは何か。
次の課題は推論を非常に高速にし、モデルが素早く答えを取得して会話が自然に感じられるようにすることだと述べている。
Wen氏によれば、音声AIはすでに何を達成したか。
聞きながら話せる全二重モデルを開発するというマイルストーンに業界は到達したと述べている。
TechCrunch AI元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へエージェント的タスク、再試行にコスト