
何が起きたか
DeepLがDeepL Voiceで音声から音声へのリアルタイム翻訳を正式提供。新しいVoice AIモデルと、30以上の言語のうち14言語での話者マッチに対応する。
なぜ重要か
言語をまたぐ会話でも元の話者の声と話し方を保てるため、グループ会議で誰が話しているか分かりやすくなる。
注目点
現在は音声認識・翻訳・音声出力が3つの別モデルで順次動作しており、統合モデルが実際に遅延を減らせるかどうか。
誰に効くか最も恩恵を受けるのは、多言語会議を開く多国籍チームや企業だ。参加者はDeepL Voiceのライセンスなしで、QRコードを読み取って自分の端末からグループ会話に参加できる。プライバシーに敏感な業界の企業も注目するかもしれない。DeepLは処理した音声を使用後にサーバーから削除するとしている。
こういう要約が、毎朝あなたのメールに届きます。
DeepL Voiceは2024年11月、リアルタイム音声翻訳サービスとして初めて発表された。ウェブ会議向けのDeepL Voice for Meetingsと、対面会話向けのDeepL Voice for Conversationsの2つに分かれている。これまでは音声をテキストに翻訳する機能だったが、音声to音声機能は2025年10月に開発中として披露され、2026年4月からアーリーアクセスによるベータ版として提供されてきた。正式提供は、テンポやイントネーション、ピッチ、話し方を翻訳音声に反映する新しいVoice AIモデルと同時に実現した。
会議向けでは、DeepLは従来の課題を解消する。ブラウザ版では、ユーザーが会議リンクをDeepLに貼り付け、翻訳ボットを手動で通話に送る必要があった。新しいWindows/Mac向けデスクトップアプリはZoom、Microsoft Teams、Google Meetのセッションを検出し、ワンクリックで接続する。対面利用では、グループ会話機能が仮想ルームを作成し、参加者はスマートフォンを1台回し渡すのではなく、各自の端末から最大20人まで参加できる。
DeepLは他のAIツールの中にも自らを位置づけている。22日に発表されたMCP対応により、Microsoft Copilot、ChatGPT、ClaudeがDeepLを呼び出し、社内用語集や独自ルールを適用した翻訳ができる。ユーザーがテキストをコピーして結果を貼り戻す必要はない。ハードウェアについてDeepLは、AIグラスを自社で作る計画はないとしつつ、音声翻訳APIによってデバイスメーカーが翻訳表示アプリをその上に構築する余地を残している。
目下の焦点は遅延だ。DeepL Voiceは現在、音声認識・翻訳・音声出力を3つの別モデルで順次実行しており、DeepLは入力を出力まで一括で処理する統合モデルを開発中。この統合モデルが実現するかどうかが、翻訳音声が自然な会話にどれだけ近く感じられるかを左右しそうだ。
業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
東京地裁は津田健次郎がTikTokにAI音声クローン動画の削除を求めた申し立てを、既に削除済みとして棄却

ElevenLabsがEleven v4とTurboを公開した

AHSが9月29日、Synthesizer V 2用の歌声データベース2製品を発売

NTT西日本のVOICENCEは2026年9月28日、無料の「声の相談窓口」を開設すると発表

AWSはvLLM-Omni Deep Learning Containerを使いAmazon SageMaker AI上にQwen3-TTSを展開するチュートリアル第1部を公開

Modulateが2500万ドルを調達