
Googleがリアルタイム音声認識モデル「Gemini 3.5 Transcribe」を公開。
85言語に対応し、言い間違いを自動修正する。
何が起きたか
Googleが音声認識モデル「Gemini 3.5 Transcribe」を公開。リアルタイム文字起こしに対応し、言い間違いを自動修正するほか、「えーっと」などのつなぎ言葉を除去する。
なぜ重要か
Googleによると、ストリーミング時の語彙誤り率は4.0%、録音音声では2.6%。前モデル「Chirp 3」と比べレイテンシーが70%低い。また「ファンクションコーリング」で画像生成やウェブ検索などのタスクを他のGeminiモデルに引き渡せる。
注目点
Google AI StudioとGemini Enterprise Agent Platformで利用可能。Android版GboardとmacOS版Geminiアプリにはすでに組み込まれており、Chromeへの対応も間もなく予定されている。
今回の発表は、Googleがこれまで手がけてきたChirp 3による音声認識技術の延線上にある。Gemini 3.5 Transcribeはレイテンシーを70%削減し、直接的な改善を実現した。すでにAndroid向けGboardやmacOS向けGeminiアプリに搭載されており、幅広いサービスへの統合を見据えた位置づけだ。85以上の言語を自動認識し、テキストを自動整形する機能は、文字起こしをよりシームレスにすることを狙っている。
さらに「ファンクションコーリング」によって、画像生成やウェブ検索といった作業を他のGeminiモデルに引き継げる設計だ。これはこのツールが単なる音声テキスト変換にとどまらず、AIによる一連の処理の入り口として機能することを示している。Chrome対応も予定されており、利用可能なプラットフォームは今後さらに広がる見通しだ。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Plaud Inc.は、AIエージェントのモバイルインターフェースとなるイヤホンと充電ケースのセット「Plaud One Explorer Edition」を発表した
Nothingの元従業員2人が設立したRelayが、高忠実度の音声文字変換向け専用マイクを発表します

香港拠点のVotee AIは、MetaのLlamaやAlibabaのQwenなどオープンウェイトモデルを広東語データで追加学習し、コーパスを1億トークンから5億トークン以上に拡大

マイクロソフト共同創業者のビル・ゲイツ氏は火曜日、約6,000語のエッセイを発表し、AI時代への移行は「人類史で最も激動の時代」の一つになると警鐘を鳴らし、数百万人の雇用が危険にさらされていると述べた
テスラは中国市場向けに自社のGrokモデルを一旦置き、スマートコックピットにByteDanceの現地対応大規模言語モデル(LLM)「Doubao」を採用する

Semaforの分析で、過去1か月にThe Wall Street Journal、The Washington Post、The New York Timesに寄せられたゲスト投稿310本のうち、10本が80%以上AI…
