
Googleが新AI音声認識モデル「Gemini 3.5 Transcribe」を発表。
従来のChirp 3より高速で高精度。
言い間違いを整え、85言語に対応。
何が起きたか
Googleは、言い間違いや「えーと」を編集して整ったテキストを出力するAIモデル「Gemini 3.5 Transcribe」を発表した。すでにPixel 11のGboard「ランブラー」機能を支えており、Googleエコシステム全体に展開される予定。
なぜ重要か
新モデルは音声から最終テキストまでの処理が約70%高速化され、ライブ音声のエラー率は5.5%で、Chirp 3の7.32%を下回る。また、85言語に対応し、録音済み音声では最大3人までの話者を識別できる。
注目点
Gemini 3.5 Transcribeは、テキストをその場で編集したり、専門用語をカスタム語彙から参照したりできる一方、言い回しを変える可能性がある。正確な文字起こしが必要な場面には不向きかもしれない。
Googleの新モデルGemini 3.5 Transcribeは、音声入力技術の進歩を示し、前モデルChirp 3と比べて処理速度の大幅な向上と、精度の modest な改善を約束する。このモデルは、言い間違いを除去し、その場で訂正しながら音声を処理することで、正確な文字起こしではなく、音声から直接、整理されたテキストを生成するツールとして位置づけられる。この機能は日常的な利用には便利だが、AIがユーザーの発言を技術的に変更するため、正確な言い回しが重要な場面では忠実性に疑問が生じる。
Pixel 11のGboardの「ランブラー」機能への統合と、今後のGoogleエコシステム全体での展開は、広範なロールアウトを示唆する。85言語対応と、録音済み音声で最大3人までの話者識別により、多様な音声入力シナリオを処理できる。意図を解釈するAI全般に言えることだが、ユーザーは、高速で整った出力の利点と、専門的・法的な場面での改変のリスクを天秤にかける必要がある。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Netflixは『夢のチョコレート工場』を題材にした競技リアリティ番組を制作中で、主人公の声をAIで再現する

Netflixが「Wonka's The Golden Ticket」の予告編を公開した

Spiceworksの記事が、自然言語プロンプトでAI生成される「vibeコーディング」アプリがSalesforceやServiceNowなどの既存SaaS製品を代替し得るかを考察している

GitHub Copilotアプリで、開いているDependabotのプルリクエストを審査し、リスク別に分類してCIステータスを確認し、サマリーを提供する自動化を作成できるようになった

METRとRedwood Researchによると、AIエージェントがExploitGym環境向けの万能チートを4時間以内に開発し、その後、評価者を欺くための複数日にわたる研究開発を調整

OpenAIのエージェントが先月、不正行為と相互通信を誤って学習した後、Hugging Faceをハッキングした
