
Apple研究者がマンダリン語と英語の混用に対応する音声認識システムの新しいトレーニング手法を開発。
反復的疑silon似ラベル付けによるアプローチは、ラベルなし音声データを活用して、大量の手動転写バイリンガル音声を必要としないまま精度向上を実現。
バイリンガルスピーカー向けASRの長年の課題に対応する。
何が起きたか
Appleの研究者は、反復的疑似ラベル付けトレーニング手法を初めてマンダリン・英語コードスイッチングASR(自動音声認識)に適用した。この手法は3つのフェーズで構成される:ラベルなしデータからの疑似ラベル生成、2段階のバイリンガルモデルトレーニング、そして単一の発話内で両言語を混在させる音声のパフォーマンス向上のための反復的改善。
なぜ重要か
コードスイッチング(同じ話し言葉の文章内でマンダリン語と英語を交互に使用すること)は、トレーニングデータが不足しているため、音声認識システムにとって困難だった。疑似ラベル付けの手法は、大規模なラベルなしデータセットを活用して半教師あり学習教材を作成し、手動転写されたコードスイッチング音声をそれほど必要としなくても、バイリンガルスピーカーの音声認識精度を向上させる可能性がある。
注目点
論文はこの手法の有効性を実証しているが、導入タイムラインや商用利用可能性についてはまだ明記していない。この研究はAppleの機械学習公開資料に掲載されており、同社が今後のASR製品にこの技術の応用を検討していることが示唆される。
コードスイッチングは自動音声認識に対する本物の技術的課題を提示する:バイリンガルスピーカーは自然と文の途中で言語を交互に使用するが、公開されている転写済みコードスイッチング音声の量は単言語データセットより大幅に少ない。従来の教師あり学習アプローチは大量のラベル付きトレーニングデータが必要であり、このユースケースには実用的でない。Appleの研究はこのデータ不足に対処するために、ラベルなし音声を活用する半教師あり技術である疑似ラベル付けを採用している。コードスイッチング発話すべての人による転写を必要とする代わりに、システムはまず自動的に候補転写を生成してから反復的に改良される。3段階の構造(初期疑似ラベル生成、バイリンガルモデルトレーニング、反復的改善)は、初期自動ラベル付けによって導入される転写エラーを段階的に削減し、各サイクルで合成トレーニングデータをより信頼性の高いものにするよう設計されている。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Apple Musicは年内に、「かなりの部分」をAIで制作した楽曲に「Made With AI」ラベルを追加する

あるソフトウェアエンジニアがSchmaudioを開発した

研究者が広く使われているオープンソースの音声認識モデル11個をテストしたところ、最も高スコアのいくつかが、VoxPopuliとLibriSpeechベンチマークから不正確な文字起こしを再現していることが判明した

Adobeは3つのAI音声ツール—Generate Music(動画用ロイヤリティフリー音楽)、Generate Speech(スクリプト→ナレーション変換)、Generate Sound Effects(シーン音声)—…

AdobeはFirefly(同社のAI創作ツール)に音声生成機能を一般向けに提供開始した
詐欺師がAI音声クローンとディープフェイク技術を駆使して信頼できる連絡先になりすまし、個人情報を含むフィッシングメールを送信し、メール、電話、メッセージングプラットフォーム、ソーシャルメディアにわたって同時に組織的な攻撃…
