
何が起きたか
Google DeepmindがGemini 3.8 Liveと3.8 Live Extended ThinkingをGemini APIとGoogle AI Studioで公開。
なぜ重要か
Googleの音声入力は1分0.005ドル、出力は0.018ドルで、OpenAIの1分0.05ドルよりはるかに安い。1時間の音声会話はGoogleで約1.38ドル、OpenAIでは少なくとも3.00ドルかかる。
注目点
OpenAIのモデルはフルデュプレックスにより依然としてより自然な会話を実現するはずで、デモを見る限り音質も良く、Googleが再び品質より価格を優先したことをうかがわせる。
誰に効くか音声エージェントを開発する開発者にとって、Speech-to-Speechの低コストな選択肢が増えたことになり、1分あたりの音声コストが積み上がる大量の通話やアシスタント業務を運用するチームに響く可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
Google DeepmindによるGemini 3.8 Liveと3.8 Live Extended Thinkingの公開は、開発者向けのSpeech-to-Speechモデルが広がりつつある分野に新たな選択肢を2つ加えるものだ。Extended Thinking版はArtificial Analysis Speech-to-Speech Leaderboardで82.6%を記録して首位に立ち、この指標ではOpenAIの最新GPT-Live-1モデルを上回る。一方、標準のGemini 3.8 Liveは、バックグラウンドでAPI呼び出しを行い、視覚入力を処理し、同時に会話を続けられる音声エージェント向けに位置づけられ、97以上の言語をサポートする。
最も明確な違いは価格差だ。Googleの音声入力1分0.005ドル、出力0.018ドルという料金は、音声会話1時間あたり約1.38ドルに相当し、1分0.05ドルのOpenAIのGPT-Live-1の少なくとも1時間3.00ドルと比べられる。同時に記事は、OpenAIのモデルがフルデュプレックス(同時に聞いて話せる仕組み)により依然としてより自然な会話を実現するはずで、デモを見る限り音質も良いと指摘している。
両者を選ぶ開発者にとって、トレードオフはリーダーボードでの性能と低コストが、OpenAIのモデルが持つとされるより自然な会話感を上回るかどうかにかかっているようだ。記事はこれを、Googleが再び品質より価格を優先したものと位置づけているが、そのトレードオフの実際の重みは、各モデルが実運用でどう機能するかにかかっている。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。