
何が起きたか
開発者のoboroge0氏が、GPUもクラウドAPIも使わずCPUだけで動くリアルタイム多言語音声認識システム「Hayamimi」を公開した。
なぜ重要か
日本語放送音声での精度と速度により、CPUのみの環境でも専用ハードに匹敵する。クラウドサービスなしでライブ多言語文字起こしを導入できる層が広がる可能性がある。
誰に効くかGPUやクラウドAPIなしでライブ文字起こしを実現したい開発者やITチーム——配信、字幕、社内ツール向け——は、メモリ2GB以下という普通のCPU上で動かせるようになった。放送局やアクセシビリティ担当者も、控えめなハードで多言語字幕が必要な場合に恩恵を受けられる。
こういう要約が、毎朝あなたのメールに届きます。
今回の公開は、CPUベースの音声認識が単一モデルに依存しがちだった流れの中にある。Hayamimiは発話ごとに言語を検出して専用モデルに振り分ける方式で、GPUなしで多言語を扱える。INT8量子化ONNXモデルをsherpa-onnx上で動かすため、PyTorchもCUDAも不要だ。精度面では、2秒の無音後に直前の発話を再デコードする二段階補正により、日本語の文字誤り率が15.5%から12.0%に改善する。話者ラベル付け、ホットワード、翻訳、ローカルHTTPサーバー経由のブラウザダッシュボードにも対応する。こうした機能から、実験室向けではなく、配信オーバーレイや文字起こしページ、ネットワーク音声入力といった実運用を狙っていることがうかがえる。混在言語の発話や同時話者の分離には対応しないといった制限が明記されており、複雑な会議環境ではなく、明瞭な単一話者の場面向けの設計だ。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Appleは欧州委員会に、Huxe AIの特定従業員に雇用を申し出て合意し、Huxeの知的財産権の非独占ライセンスを取得すると伝えた

Bragi CEOのNikolaj Hviid氏は、AIオーディオは独自のインターフェースを模索中で、市場には異なるブランド、チップ、ソフトウェア、サービスをつなぐ共通基盤が欠けていると述べた

人間1人とAIボーカリスト彩瀬??が運営する音楽ユニットRESONALが、企画からリリース準備まで、AIとの対話で曲を作る工程を解説するガイドを公開した

OpenAIがChatGPTで音声ファイルのアップロードに対応し、文字起こしや要約、内容に関する質問への回答が可能になった

NECネクサソリューションズが2026年10月6日、「対話型音声AIエージェント Powered by DEN.Ai」の提供を開始

Automation Anywhereは水曜、会話型音声AI企業Boost.aiをNordic Capitalから買収する合意を発表した