AIToday
画像生成動画生成Amazon AI Blog掲載日時: 2026年9月29日 4:00

SageMaker AI、vLLM-Omniで画像・動画生成の使い分け

LINEで送る
SageMaker AI、vLLM-Omniで画像・動画生成の使い分け

3つのポイント

  1. 何が起きたか

    AWSはvLLM-Omni Deep Learning ContainerでFLUX.2-klein-4Bをリアルタイム推論、Wan2.1-VACE-1.3Bを非同期推論で動かすサンプルを公開した。

  2. なぜ重要か

    同じコンテナで画像と動画の両モデルを動かせるため、モデルごとに別の推論基盤を用意せず、応答時間やデータ量に応じて推論方式を選べるとみられる。

  3. 注目点

    動画設定は17フレーム・30ステップが既定で、4ステップは動作確認用にとどまる。記事が示す所要時間は単発の再現用チェックポイントで、性能指標ではない点に注意が必要だ。

誰に効くか生成AIの画像・動画機能を自社サービスに組み込む開発・運用担当者に影響する。SageMaker AI上でGPUインスタンスの確保と課金が前提となるため、コスト試算とインスタンス選定が導入判断の鍵になる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この記事は、AWS Deep Learning ContainersのうちvLLM-Omniを扱うシリーズの第2弾である。第1弾では双方向ストリーミングによるリアルタイム音声を扱っており、今回は画像と動画という別の生成メディアに範囲を広げた。同じpinnedのコンテナイメージを使い、環境変数SM_VLLM_MODELの切り替えだけで、画像用のFLUX.2-kleinと動画用のWan VACEを別々のエンドポイントに配備する構成になっている。

画像はbase64のPNGとして即時に返り、それを動画用の寸法にリサイズしてJPEG化し、Wan VACEのマルチパート要求に埋め込む。要求はAmazon S3に置かれ、非同期エンドポイントに渡され、生成されたMP4はS3から取得される。128,000バイトのインラインBodyでは足りないため、この構成ではInputLocationが使われている。

この使い分けはあくまで「ワークロードに合わせた選択」であり、すべての動画モデルに当てはまる規則ではないと本文は明言する。実運用では、モデルの遅延やペイロード、クライアントの対話方式に応じて推論方式を選ぶことになり、GPUエンドポイントのコストと性能検証をどこまで詰められるかが導入の分かれ目になりそうだ。

よくある質問
画像と動画で処理方式はなぜ違うのですか?
画像は次のリクエストを作る前に直接応答が必要なためリアルタイム推論を使い、動画は長時間処理で大きなデータを扱うため非同期推論とAmazon S3を使う。
動画生成の既定設定は?
17フレームと30の拡散ステップが既定で、4ステップは動作確認用にとどまる。低い設定では元画像の構図が保たれなかったとしている。
エンドポイントの起動や生成にどれくらい時間がかかりますか?
米国東部(バージニア北部)での検証1回で、画像用のml.g6.xlargeは9分30秒でInServiceになり、画像は4.7秒、MP4は11.8秒で取得された。
Amazon AI Blog元記事を読む
LINEで送る

「画像生成」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Adobe、GeminiとClaudeに制作ツール連携ITmedia AI+ · 13時間前
  • Comfy Router、価格でAI生成API選択可GIGAZINE AI · 16時間前
  • アシックス、AIで全商品の着装イメージ生成Top Companies AI · 23時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へModulate、音声AIを開発者向けに展開へ