VerizelのAI Gatewayが音声・リアルタイム通話機能をベータ版で提供開始しました。
OpenAIとxAIのモデルに対応し、開発者は既存のテキスト・画像機能と同じ方法で音声通話、音声合成、音声認識をアプリケーションに統合できます。
従来のように複数モデルを組み合わせる必要がなく、より自然な対話が実現する点が特徴です。
何が起きたか
Vercelの開発者向けプラットフォーム「AI Gateway」が音声・リアルタイム通話機能をベータ版で提供開始しました。OpenAIとxAIのモデルに対応し、テキストや画像と同じ方法で音声通話、音声合成、音声認識を利用できます。
なぜ重要か
これまでは音声認識→言語処理→音声合成という複数モデルのチェーンが必要でしたが、単一の音声モデルが直接音声を入出力するため、より自然な対話が実現します。音声アシスタントやカスタマーサポートなど、ユーザーが話しかける方が自然なアプリケーションを開発しやすくなります。
注目点
ベータ版はAI SDK 7で利用可能です。既存のAI Gatewayユーザーは同じAPI認証情報や支出管理機能を使いながら、新たに音声機能を追加できます。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Apple Musicは年内に、「かなりの部分」をAIで制作した楽曲に「Made With AI」ラベルを追加する

あるソフトウェアエンジニアがSchmaudioを開発した

研究者が広く使われているオープンソースの音声認識モデル11個をテストしたところ、最も高スコアのいくつかが、VoxPopuliとLibriSpeechベンチマークから不正確な文字起こしを再現していることが判明した

Appleの研究者は、反復的疑似ラベル付けトレーニング手法を初めてマンダリン・英語コードスイッチングASR(自動音声認識)に適用した

Adobeは3つのAI音声ツール—Generate Music(動画用ロイヤリティフリー音楽)、Generate Speech(スクリプト→ナレーション変換)、Generate Sound Effects(シーン音声)—…

AdobeはFirefly(同社のAI創作ツール)に音声生成機能を一般向けに提供開始した