OpenAIが新型音声モデル「GPT-Live-1」を発表しました

OpenAIが新たな会話型音声モデルGPT-Live-1とGPT-Live-1 miniを発表しました

Cohereが「Cohere Transcribe Arabic」という20億パラメータのオープンソース音声認識モデルを公開しました

屋根修理・外装サービスの大手Vertex Service Partnersが、AI音声・SMS対応プラットフォーム「Revin」を全国27の地域ブランドで導入しました

Hugging FaceとCerebasが、音声認識・言語モデル・音声合成を組み合わせたリアルタイム音声対話システムのデモを発表しました

Netflixが「Wonka's The Golden Ticket」という実写競技番組を制作し、ナレーションにAI音声生成企業ElevenLabsと協力してジーン・ワイルダーのAI生成音声を使用しています

Winamp Group傘下のJamendoがSuno, Inc.を相手に米マサチューセッツ州の連邦裁判所に訴状を提出しました

AI Voice Studioというツールが提供開始され、ユーザーはスクリプトを入力するだけで70以上の言語でナレーションを生成できます

GoogleがGemini 3.5 Live Translateをリリース

ElevenLabs は英国科学イノベーション技術省(DSIT)と覚書を締結し、音声AIを公共サービスに活用する方法の探索、AI セキュリティ研究の深化、英国の音声・オーディオAI人材ハブとしての地位強化に協力する

AppleはWWDCで「Siri AI」を発表

Audio-Interactionは3billion parameterの単一モデルで、音声ストリームを連続監視し、0.4秒単位で<silent>または<response>トークンを出力して、発話か沈黙かを決定する

ElevenLabsがニューヨークでポップアップを開催し、同社の音声モデルを搭載したロボットがコーヒー注文を受け付けて飲料を準備するデモを実施

AethexAIは昨年設立され、4DX Venturesが主導する$3 millionのプリシード資金を調達

Suno が $400 million の資金調達を実施し、評価額は $5.4 billion に達した

Snowflakeが四半期で11,100から13,600へAIアカウント数が増加し、製品売上が34%成長、通年ガイダンスを$180 million引き上げたことを受け、SoundHound AI(NASDAQ:SOUN)…

AI音声生成市場は2025年の$4.16 billionから2031年には$20.71 billionに到達する見込み

Sunoのサブレディットで、ユーザーが自分で生成したAI音楽を聴くことに専念し、Spotifyなどの従来のストリーミングプラットフォームでの音楽鑑賞をやめたと述べている

StripeがAI steering実験について開発者向けブログで発表

音声エージェント、ライブキャプショニング、コンタクトセンター分析、アクセシビリティツールは、リアルタイム音声テキスト変換に依存している

Stability AI が Stable Audio 3.0 を発表

AIニュースを追う時間を、毎朝5分に。
200以上のソースから、その日の要点だけをEmail・LINE・Slackへ。ずっと無料です。
月間読者 30,000+ElevenLabsが教授向けの無料アクセスプログラム「Impact Program x Professors」を立ち上げ

Thinking Machines Lab が初のAIモデルを発表

Rivian AssistantがRivian Gen 1およびGen 2の互換車両オーナーに対してソフトウェア更新経由で本日配信開始

リアルタイム音声AIパイプライン向けの軽量性別分類器をリリース

Vapiのエンタープライズ事業は2025年初頭以降10倍成長

Wispr FlowがHinglish(ヒンディー語と英語の混合言語)のロールアウト後、インドでの成長加速を報告

TypeWhisperというMac向けの音声テキスト変換ツールがGitHubで公開された

Dikaletus は TUI ツールで、FFmpeg、PulseAudio、Mistral AI API を用いて会議の音声録音、文字起こし、構造化されたミーティングノート生成を自動化する

OpenAIはRealtime APIで3つの新しいストリーミング音声モデルを提供開始:GPT-Realtime-2(音声対音声推論エージェント向け)、GPT-Realtime-Translate(70以上の入力言語から…

OpenAIがGPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisperという3つの新しい音声モデルを提供開始

Googleのスマートホーム向けAI統合が、2025年のAI刷新以来、最大規模のアップデートを受けた

ElevenLabsが新たな投資家としてBlackRock、Jamie Foxx、Eva Longoria を獲得し、年間経常収益(ARR)が$500M に到達した

GitHub上で公開されたPAVO-Benchは、音声認識(ASR)からLLM(文章を理解・生成するAI)を経由してテキスト音声変換(TTS)に至る一連の処理を評価するためのベンチマークデータセット

GitHubで公開されたVoiceGoatは、音声エージェント(ユーザーの音声指示に応じて自分で判断して作業するAI)に対するLLM(大規模言語モデル)攻撃を練習するためのツール

MicrosoftがVibeVoiceという音声AIモデルをGitHubで公開
Ubuntu開発元のCanonicalのエンジニアリング担当VP Jon Seagerが月曜日にブログ投稿を公開し、Linux ディストリビューションへのai機能追加計画を発表した

ComfyUI は AI 画像・動画・音声生成ツールの開発企業で、今回 3000 万ドルの資金調達を実施し、企業価値が 5 億ドルに達した

調査によると、米国の成人の50%以上が過去1週間の間に仕事でAI(ChatGPTなどの文章生成AI)を使用している

TTS.aiは新しいテキスト音声変換プラットフォームとして発表された

transformers.js、Whisper、WebGPUを使用してクライアント側で完全にローカルで動作するAIワークスペースを開発

200以上のソースから厳選したAIニュースを毎日無料でお届けします。
月間読者 30,000+
無料で始める登録無料・30秒で完了・いつでも解除できます