
リアルタイム音声AIパイプライン向けの軽量性別分類器をリリース。モデルサイズ0.64 MB、パラメータ166K、CPU単一スレッド推論で約4 ms。ONNX形式でエクスポート、推論時にPyTorchは不要。
2層双方向LSTM(時系列データを両方向で処理するニューラルネットワーク)とソフト注意メカニズムを採用。16 kHz 3秒音声クリップの40 MFCC係数(音声の周波数特性を抽出した特徴量)を入力として、シグモイド関数で性別を判定。
LibriSpeech test-cleanで94.4%精度、FLEURS多言語テスト(EN/DE/FR/ES/IT)で94.3%精度を達成。ただしEdAcc(訛りのある国際英語)では75.6%に低下するため、強い訛りを持つ話者には VCTK などの訛り付きコーパスでの再学習が必要。
訓練データはLibriSpeech train-clean-100と FLEURS訓練セット(5言語)で、男女50/50にバランス調整。グラマティカルジェンダーを持つポーランド語、ドイツ語、フランス語、スペイン語、イタリア語などで、音声から話者の性別を認識して文法的な形態変化に対応するユースケースを想定。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
三菱電機と米国子会社Mitsubishi Electric Research Laboratoriesは、テキストによる指示で混合音声から指定した音を分離・抽出できる単一のAIモデルを開発した

EDMプロデューサーのMax "H4RRIS" Harrisと、イタリアのターンテーブリストからプロデューサーに転身したNihil Youngが、EDMシーンにおけるAI生成音楽を公然と批判している

Beatportは、全体または大部分をAIで制作されたトラックを禁止した

消防庁は2027年度に119番通報のAI活用に関するモデル事業を始める計画だ

AWSは、エージェント型AIワークスペース「Amazon Quick」が、Model Context Protocol(MCP)を通じてfalの生成メディアプラットフォームと連携する統合を発表した

LeafnetとBBIXは2026年8月、音声とAIを組み合わせた新サービスの構築に向けた協業を開始した
