AIToday
音声・スピーチApple Machine Learning掲載日時: 2026年8月21日 10:003分で読める

Appleがコードスイッチング音声認識を改善

LINEで送る
Appleがコードスイッチング音声認識を改善

要点

  • Apple研究者がマンダリン語と英語の混用に対応する音声認識システムの新しいトレーニング手法を開発。

  • 反復的疑silon似ラベル付けによるアプローチは、ラベルなし音声データを活用して、大量の手動転写バイリンガル音声を必要としないまま精度向上を実現。

  • バイリンガルスピーカー向けASRの長年の課題に対応する。

3つのポイント

  1. 何が起きたか

    Appleの研究者は、反復的疑似ラベル付けトレーニング手法を初めてマンダリン・英語コードスイッチングASR(自動音声認識)に適用した。この手法は3つのフェーズで構成される:ラベルなしデータからの疑似ラベル生成、2段階のバイリンガルモデルトレーニング、そして単一の発話内で両言語を混在させる音声のパフォーマンス向上のための反復的改善。

  2. なぜ重要か

    コードスイッチング(同じ話し言葉の文章内でマンダリン語と英語を交互に使用すること)は、トレーニングデータが不足しているため、音声認識システムにとって困難だった。疑似ラベル付けの手法は、大規模なラベルなしデータセットを活用して半教師あり学習教材を作成し、手動転写されたコードスイッチング音声をそれほど必要としなくても、バイリンガルスピーカーの音声認識精度を向上させる可能性がある。

  3. 注目点

    論文はこの手法の有効性を実証しているが、導入タイムラインや商用利用可能性についてはまだ明記していない。この研究はAppleの機械学習公開資料に掲載されており、同社が今後のASR製品にこの技術の応用を検討していることが示唆される。

この記事についてAIに質問する →

背景と解説

コードスイッチングは自動音声認識に対する本物の技術的課題を提示する:バイリンガルスピーカーは自然と文の途中で言語を交互に使用するが、公開されている転写済みコードスイッチング音声の量は単言語データセットより大幅に少ない。従来の教師あり学習アプローチは大量のラベル付きトレーニングデータが必要であり、このユースケースには実用的でない。Appleの研究はこのデータ不足に対処するために、ラベルなし音声を活用する半教師あり技術である疑似ラベル付けを採用している。コードスイッチング発話すべての人による転写を必要とする代わりに、システムはまず自動的に候補転写を生成してから反復的に改良される。3段階の構造(初期疑似ラベル生成、バイリンガルモデルトレーニング、反復的改善)は、初期自動ラベル付けによって導入される転写エラーを段階的に削減し、各サイクルで合成トレーニングデータをより信頼性の高いものにするよう設計されている。

よくある質問

音声認識におけるコードスイッチングとは何か?
コードスイッチングは、同じ話し言葉の発話内で2つの言語を交互に使用することで、例えばスピーカーがマンダリン語と英語の単語の両方を含む文章を話す場合。ASRシステムはコードスイッチング音声のトレーニングデータが限定的であるため、この処理に苦労している。
疑似ラベル付けアプローチはどのように機能するのか?
この手法は大規模なラベルなし音声コーパスから疑似ラベル(自動割り当て転写)を生成し、半教師あり学習データセットを作成する。その後、2段階のバイリンガルモデルトレーニングに使用され、続いてコードスイッチング音声認識パフォーマンスを向上させるための反復的改善が行われる。
Apple Machine Learning元記事を読む

「音声・スピーチ」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

Apple Music、AI制作曲にラベル導入へ

Apple Musicは年内に、「かなりの部分」をAIで制作した楽曲に「Made With AI」ラベルを追加する

Top Companies AI17時間前

AIオーディオストーリーをソフトウェアエンジニアが開発

あるソフトウェアエンジニアがSchmaudioを開発した

Hacker News2日前

高性能音声AI、ベンチマーク最適化の兆候

研究者が広く使われているオープンソースの音声認識モデル11個をテストしたところ、最も高スコアのいくつかが、VoxPopuliとLibriSpeechベンチマークから不正確な文字起こしを再現していることが判明した

Hugging Face Blog2日前

Adobe、AI音声ツールとGemini統合を発表

Adobeは3つのAI音声ツール—Generate Music(動画用ロイヤリティフリー音楽)、Generate Speech(スクリプト→ナレーション変換)、Generate Sound Effects(シーン音声)—…

THE DECODER3日前

Adobe、Fireflyに音声生成機能を追加 音楽・スピーチ・効果音を商用利用可

AdobeはFirefly(同社のAI創作ツール)に音声生成機能を一般向けに提供開始した

SiliconANGLE AI3日前

AI音声クローン、詐欺攻撃急増

詐欺師がAI音声クローンとディープフェイク技術を駆使して信頼できる連絡先になりすまし、個人情報を含むフィッシングメールを送信し、メール、電話、メッセージングプラットフォーム、ソーシャルメディアにわたって同時に組織的な攻撃…

Top Companies AI4日前
次の記事へAI革命、実課題解決へ 雇用不安は後退