
何が起きたか
GoogleがGemini 3.8 Liveと3.8 Live Extended Thinkingをリリース。OpenAIのGPT-Liveファミリーに似た音声対音声モデル2種。
なぜ重要か
Googleは標準モデルと拡張思考向けの2段階のライブ音声モデルを提供し、OpenAIのGPT-Liveの構成に対応した。
注目点
開発者がモデルと音声プリセットを選び、システムプロンプトを入力し、発話中に割り込めるブラウザデモを公開。GoogleがWebSocket APIの自社チュートリアルを出すか注目。
誰に効くか音声インターフェースを構築する開発者は、Googleの音声対音声モデル2種から選べるようになり、一方は拡張思考向けに調整されている。WebSocket APIのチュートリアルに従うツール開発者は、追加ライブラリなしでブラウザ上で試せる。
こういう要約が、毎朝あなたのメールに届きます。
GoogleがGemini 3.8 Liveと3.8 Live Extended Thinkingをリリースしたことで、音声対音声モデルが2種ラインナップに加わった。この2つはOpenAIのGPT-Liveファミリーの構成を映しており、標準モデルと拡張思考版の1つずつという形だ。Googleはこの2つを別個の製品ではなく、ライブ音声アプリケーション向けの選択肢として位置づけていることをうかがわせる。
リリースに合わせて、ドキュメントに基づくブラウザベースのデモUIも作られた。ユーザーはモデルと音声プリセットを選び、任意のシステムプロンプトを入力し、モデルが話している途中に割り込める音声会話を楽しめる。実装はあえてライブラリを避け、GoogleのWebSocketエンドポイントに直接接続し、キャプチャと再生の両方にWeb Audio APIのAudioContextを使っている。これはこれらのモデルのクライアントがいかに軽量になり得るかを示している。
これらのモデルの実用的な試金石は、開発者が重い依存関係なしにライブ音声会話を動かせるかどうか、そしてGoogle自身のチュートリアルがその設定を簡単にしているかどうかだろう。音声インターフェースを構築するチームにとっては、ライブの回答により多くの思考時間が役立つ場面で拡張思考版が最も重要になるかもしれないが、それは実際にモデルがどう振る舞うかにかかっている。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
GoogleはGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを発表、Extended ThinkingはArtificial Analysis Speech to Sp…
SalesforceはDreamforceで、NvidiaのNemotronオープンウェイト基盤で構築した推論モデルKoaと、37の既製営業スキルを導入するClaudeforceを発表した
ProfoundはSequoia CapitalとKleiner Perkinsが共同で主導したシリーズDで、18億ドル評価にて1億8000万ドルを調達した
日立はレガシー刷新でAIがコード変換を担うとしつつ、エンジニアの役割は拡大すると主張

Sam Altman氏はFortuneに、OpenAIがAnthropicやGoogle DeepMindなどと業界全体のAI開発鈍化を調整することに賛成だと述べ、近く合意が発表されると示唆した

元CTOの著者は、AIが事実上誰もをコーダーにしたと述べる
