AIToday
音声・スピーチHacker News掲載日時: 2026年5月12日 22:011分で読める

欧州言語向け音声性別分類器、0.64 MBで4ms推論——LibriSpeechテストで94.4%精度

LINEで送る
欧州言語向け音声性別分類器、0.64 MBで4ms推論——LibriSpeechテストで94.4%精度

3つのポイント

  1. リアルタイム音声AIパイプライン向けの軽量性別分類器をリリース。モデルサイズ0.64 MB、パラメータ166K、CPU単一スレッド推論で約4 ms。ONNX形式でエクスポート、推論時にPyTorchは不要。

  2. 2層双方向LSTM(時系列データを両方向で処理するニューラルネットワーク)とソフト注意メカニズムを採用。16 kHz 3秒音声クリップの40 MFCC係数(音声の周波数特性を抽出した特徴量)を入力として、シグモイド関数で性別を判定。

  3. LibriSpeech test-cleanで94.4%精度、FLEURS多言語テスト(EN/DE/FR/ES/IT)で94.3%精度を達成。ただしEdAcc(訛りのある国際英語)では75.6%に低下するため、強い訛りを持つ話者には VCTK などの訛り付きコーパスでの再学習が必要。

  4. 訓練データはLibriSpeech train-clean-100と FLEURS訓練セット(5言語)で、男女50/50にバランス調整。グラマティカルジェンダーを持つポーランド語、ドイツ語、フランス語、スペイン語、イタリア語などで、音声から話者の性別を認識して文法的な形態変化に対応するユースケースを想定。

この記事についてAIに質問する →

LINEで送る

「音声・スピーチ」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • 三菱電機、汎用音分離AIを開発Top Companies AI · 13時間前
  • 音楽家探偵団がAI音楽詐欺を追うThe Verge AI · 2日前
  • Beatport、DJ市場でAI生成音楽を禁止THE DECODER · 3日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へDessn、生産コードベースに直接対応するAI駆動設計ツール構築のため$6Mを調達