AIToday
大規模言語モデル音声・スピーチAmazon AI Blog掲載日時: 2026年9月29日 4:00

AWS、SageMaker AIでQwen3-TTS配信

LINEで送る
AWS、SageMaker AIでQwen3-TTS配信

3つのポイント

  1. 何が起きたか

    AWSはvLLM-Omni Deep Learning Containerを使いAmazon SageMaker AI上にQwen3-TTSを展開するチュートリアル第1部を公開。

  2. なぜ重要か

    Qwen3-TTSは応答全体を生成し終える前に音声を返すため、音声エージェントはより早く発話を開始でき、対話型音声アプリを遅く感じさせる無音の間を短縮できる。

  3. 注目点

    サンプルはml.g6.xlarge、ml.g6e.xlarge、ml.g5.xlarge、ml.g4dn.xlargeへフォールバックするSageMakerインスタンスプールを使うが、記載の全タイプのクォータが必要で、時間料金は選択したインスタンスで変わりうる。

誰に効くかAWS上で音声エージェント、アクセシビリティツール、カスタマーサービスアシスタントを構築するAIアプリ開発者やプラットフォームエンジニアは、テキスト読み上げ出力をストリーミングする具体的なサンプルを追随できるようになった。SageMaker AIでGPUエンドポイントを運用するチームは、エンドポイントのクォータとクリーンアップも管理する必要がある。稼働中のGPUエンドポイントは課金が続くためだ。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

このチュートリアルは、音声パイプラインの入力側を扱った以前のAWS記事を土台にしている。マイク音声をVoxtral-Mini-4B Realtime音声認識モデルへストリーミングし、文字起こしイベントを返す内容だ。今回の記事は出力側を追加し、テキストをQwen3-TTSへ送り、生成された音声をvLLM-Omni DLC経由でストリーミングして返す。2つの例を合わせると、相補的な経路が見えてくる。マイク音声を文字起こしへ流し込み、アプリのテキスト応答を音声として返す。この2つのエンドポイント間のオーケストレーションはウォークスルーの範囲外のままだ。

vLLM-Omniプロジェクトは、vLLMをテキスト生成の枠を超えて拡張し、テキスト、音声、画像、動画を処理または生成するモデルを提供する。その異種パイプライン抽象化は、自己回帰段階や拡散段階を含む多段ワークフローを調整する。AWSは追跡しているvLLM-Omniリリースを独自イメージにパッケージし、SageMaker AI向けのルーティングミドルウェアを追加している。記事がQwen3-TTSを焦点の絞った例として使うのは、ストリーミング音声が双方向音声出力を直接示す手段になるためであり、同じDLCファミリーを第2部で画像・動画生成にも適用すると述べている。

音声アプリを構築するチームにとって実務上の問いは、このパターンが音声エージェントを遅く感じさせる無音の間を減らすかどうかだ。サンプルが記載の各タイプのインスタンスプールとクォータに依存していることは、この手法の有用性が、キャパシティとコストが想定ワークロードと噛み合うかどうかにかかっている可能性を示唆する。

よくある質問
このチュートリアルはどのモデルを展開しますか?
Amazon SageMaker AI上のAWS vLLM-Omni Deep Learning Containerを通じて、音声合成モデルのQwen3-TTSを展開する。
ストリーミング出力はどの音声形式を使いますか?
サンプルはパルス符号変調(PCM)出力を設定し、Gradioクライアントが受け取るたびに各24 kHz PCMチャンクを再生する。
SageMakerが最初のインスタンスタイプを確保できない場合はどうなりますか?
サンプルはインスタンスプールを使う。SageMakerはまずml.g6.xlargeを試し、キャパシティがない場合はml.g6e.xlarge、ml.g5.xlarge、ml.g4dn.xlargeへフォールバックする。
Amazon AI Blog元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝1分で

業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へModulate、音声AIを開発者向けに展開へ