AIToday
音声・スピーチオープンソースAIAmazon AI Blog掲載日時: 2026年9月26日 4:00

AWS、SageMakerで音声クローン

LINEで送る
AWS、SageMakerで音声クローン

3つのポイント

  1. 何が起きたか

    AWSはQwenチームのQwen3-TTS-12Hz-1.7B-BaseをAmazon SageMaker JumpStart経由でリアルタイムエンドポイントに導入する方法を詳説した。

  2. なぜ重要か

    選んだ話者の声で、10言語のいずれでも、わずか数秒の参照音声から音声を生成できるようになった。モデルの再学習や大規模な学習データセットの収集は不要だ。

  3. 注目点

    導入が約24 GBのGPU内に収まるかだ。talkerとcode2wav間でGPUメモリを分割することが鍵。KVキャッシュのトークン予算56,928トークンに注目。

誰に効くかパーソナライズされた音声体験を構築したり多言語コンテンツをローカライズしたりするメディアチーム、教育者、アプリケーション開発者は、自社のマネージドAWSエンドポイント上で音声クローンを実行できるようになった。コンタクトセンターやバーチャルアシスタントの構築担当者は、一貫したブランドボイスの恩恵を特に受けられるかもしれないが、導入にはGPUメモリの構成とルーティングの知識が必要だ。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Qwen3-TTSファミリーはAlibaba CloudのQwenチームが開発し、Qwen3-TTS-Tokenizer-12Hz音声トークナイザーを用いて、低遅延の対話シナリオ向けにストリーミング生成をサポートする。ここで使うBaseバリアントは数秒のユーザー音声から音声クローンを行い、ファインチューニングのベースとしても使える。ユーザー提供の参照ではなく固定の定義済み話者から音声を生成するCustomVoiceバリアントとは異なる。

導入ではモデルを同一GPU上の2ステージとして実行する。テキストと参照音声から音声トークンを生成するtalkerステージと、それらを波形にレンダリングするcode2wavステージだ。コンテナ起動時に各ステージがエンドポイントのCloudWatch Logsロググループにメモリ使用量を記録する。talkerモデルの重みは3.66 GiB、code2wavモデルの重みは0.45 GiBで、残りのメモリの大半がKVキャッシュになる。KVキャッシュとは処理中のリクエストのトークンを保持する作業メモリだ。

この導入の鍵となる試練は、2ステージの合計GPUメモリ予約を24 GBの容量内に収めつつ、十分な数の同時リクエストをさばけるかどうかだ。記事は、TTSリクエストは通常短いため1インスタンスで複数の同時リクエストに対応できるが、トラフィックが増える場合はより多くのインスタンスかより大きなGPUが必要になると指摘する。チュートリアルは構成と監視でそのバランスを管理する方法を示しており、音声対応アプリケーションを構築するチームにとってこのニュースの実用的価値はそこにある。

よくある質問
音声をクローンするにはどれくらいの参照音声が必要ですか?
数秒の参照音声で十分です。クリップ内で話された言葉の文字起こしも必要です。
モデルはどの言語に対応していますか?
中国語、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語、ポルトガル語、スペイン語、イタリア語の10言語に対応しています。言語をまたいだクローンでは、ある言語で音声を捉え、別の言語で音声を生成できます。
このモデルを動かすにはどのGPUインスタンスが必要ですか?
チュートリアルではml.g6.4xlarge(1x NVIDIA L4 GPU、24 GB)を使用しており、1.7Bモデルには十分です。構成ではtalkerとcode2wavの両ステージにGPUメモリ使用率0.45を適用し、24 GBのGPU内に収めています。
Amazon AI Blog元記事を読む
LINEで送る

「音声・スピーチ」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • マクドナルド、AIドライブスルー「Archy」公開Semafor Tech · 2時間前
  • SonyとUMG、Sunoを再提訴The Verge AI · 5時間前
  • Google「Call for Me」をテストTHE DECODER · 8時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へProactionのColin Knudsen、Codexでデモを自作し成約率を50%から60%に向上