AIToday
音声・スピーチGIGAZINE AI掲載日時: 2026年10月11日 13:00

CPUのみで動く多言語音声認識システム公開

LINEで送る
CPUのみで動く多言語音声認識システム公開

3つのポイント

  1. 何が起きたか

    開発者のoboroge0氏が、GPUもクラウドAPIも使わずCPUだけで動くリアルタイム多言語音声認識システム「Hayamimi」を公開した。

  2. なぜ重要か

    日本語放送音声での精度と速度により、CPUのみの環境でも専用ハードに匹敵する。クラウドサービスなしでライブ多言語文字起こしを導入できる層が広がる可能性がある。

誰に効くかGPUやクラウドAPIなしでライブ文字起こしを実現したい開発者やITチーム——配信、字幕、社内ツール向け——は、メモリ2GB以下という普通のCPU上で動かせるようになった。放送局やアクセシビリティ担当者も、控えめなハードで多言語字幕が必要な場合に恩恵を受けられる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

今回の公開は、CPUベースの音声認識が単一モデルに依存しがちだった流れの中にある。Hayamimiは発話ごとに言語を検出して専用モデルに振り分ける方式で、GPUなしで多言語を扱える。INT8量子化ONNXモデルをsherpa-onnx上で動かすため、PyTorchもCUDAも不要だ。精度面では、2秒の無音後に直前の発話を再デコードする二段階補正により、日本語の文字誤り率が15.5%から12.0%に改善する。話者ラベル付け、ホットワード、翻訳、ローカルHTTPサーバー経由のブラウザダッシュボードにも対応する。こうした機能から、実験室向けではなく、配信オーバーレイや文字起こしページ、ネットワーク音声入力といった実運用を狙っていることがうかがえる。混在言語の発話や同時話者の分離には対応しないといった制限が明記されており、複雑な会議環境ではなく、明瞭な単一話者の場面向けの設計だ。

よくある質問
Hayamimiの動作に必要なハードウェアは?
Python 3.10以上とffmpegが動くCPUがあれば動作する。GPUもCUDAも不要で、モデルはsherpa-onnx上で動くINT8量子化ONNXだ。
日本語の精度はどれくらい?
実際の日本語テレビ放送音声で文字誤り率(CER)3.8%を達成した。2秒の無音後に二段階補正を行うと、CERは15.5%から12.0%に改善する。
対応言語は?
主要5言語(日本語、中国語、韓国語、広東語、英語)とヨーロッパ24言語に専用モデルがある。その他約1600言語はMeta Omnilingual ASRにフォールバックする。
字幕のリアルタイム翻訳はできる?
できる。--translateオプションを使えば、日本語字幕を英語や中国語、韓国語、スペイン語などの対象言語にリアルタイムで翻訳できる。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へtheCUBEがAIデータパイプライン会議を13日配信