
何が起きたか
AWSはQwenチームのQwen3-TTS-12Hz-1.7B-BaseをAmazon SageMaker JumpStart経由でリアルタイムエンドポイントに導入する方法を詳説した。
なぜ重要か
選んだ話者の声で、10言語のいずれでも、わずか数秒の参照音声から音声を生成できるようになった。モデルの再学習や大規模な学習データセットの収集は不要だ。
注目点
導入が約24 GBのGPU内に収まるかだ。talkerとcode2wav間でGPUメモリを分割することが鍵。KVキャッシュのトークン予算56,928トークンに注目。
誰に効くかパーソナライズされた音声体験を構築したり多言語コンテンツをローカライズしたりするメディアチーム、教育者、アプリケーション開発者は、自社のマネージドAWSエンドポイント上で音声クローンを実行できるようになった。コンタクトセンターやバーチャルアシスタントの構築担当者は、一貫したブランドボイスの恩恵を特に受けられるかもしれないが、導入にはGPUメモリの構成とルーティングの知識が必要だ。
こういう要約が、毎朝あなたのメールに届きます。
Qwen3-TTSファミリーはAlibaba CloudのQwenチームが開発し、Qwen3-TTS-Tokenizer-12Hz音声トークナイザーを用いて、低遅延の対話シナリオ向けにストリーミング生成をサポートする。ここで使うBaseバリアントは数秒のユーザー音声から音声クローンを行い、ファインチューニングのベースとしても使える。ユーザー提供の参照ではなく固定の定義済み話者から音声を生成するCustomVoiceバリアントとは異なる。
導入ではモデルを同一GPU上の2ステージとして実行する。テキストと参照音声から音声トークンを生成するtalkerステージと、それらを波形にレンダリングするcode2wavステージだ。コンテナ起動時に各ステージがエンドポイントのCloudWatch Logsロググループにメモリ使用量を記録する。talkerモデルの重みは3.66 GiB、code2wavモデルの重みは0.45 GiBで、残りのメモリの大半がKVキャッシュになる。KVキャッシュとは処理中のリクエストのトークンを保持する作業メモリだ。
この導入の鍵となる試練は、2ステージの合計GPUメモリ予約を24 GBの容量内に収めつつ、十分な数の同時リクエストをさばけるかどうかだ。記事は、TTSリクエストは通常短いため1インスタンスで複数の同時リクエストに対応できるが、トラフィックが増える場合はより多くのインスタンスかより大きなGPUが必要になると指摘する。チュートリアルは構成と監視でそのバランスを管理する方法を示しており、音声対応アプリケーションを構築するチームにとってこのニュースの実用的価値はそこにある。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
マクドナルドが英語とスペイン語に対応するAIドライブスルー「Archy」を公開

SonyとUniversal Music GroupがSunoを再び提訴

TechCrunchによると、Googleは「Call for Me」をテスト中

GoogleのAIロボティクス部門Intrinsicがプラットフォームの一部をオープンソース化すると発表

PrismMLはQualcommのSnapdragonチップ搭載スマートグラス向けに小型言語モデル版を開発した

AWSがWhisperX Deep Learning Containerを公開
