AIToday
大規模言語モデルAIコーディングAmazon AI Blog掲載日時: 2026年9月26日 4:00

SageMaker HyperPodで迷路解決率95%に

LINEで送る
SageMaker HyperPodで迷路解決率95%に

3つのポイント

  1. 何が起きたか

    AWSのウォークスルーで、SageMaker HyperPod上でのSkyRLのGRPOポストトレーニングにより、Qwen3-VL-8Bモデルの64迷路での解決率が43.75%から95%超に向上した。

  2. なぜ重要か

    HyperPodは故障ノードを交換し、保存済みチェックポイントからジョブを再開するため、長時間・マルチノードの強化学習を自前インフラではなくレンタルのクラウドクラスタで実行できる可能性を示す。

  3. 注目点

    この数字はピーク値であり保証ではない。AWSはステップ160で96.875%(64迷路中62)と報告し、結果はハイパーパラメータや迷路設定によって変わるとしている。実際の数値はそれら次第だ。

誰に効くか視覚言語モデルをポストトレーニングするMLプラットフォームおよびインフラチームは、GPUクラスタを自前で持たずにGRPOワークロードを実行するのにHyperPodのノード交換とチェックポイントで十分かを検討するだろう。ただしAWSの結果は1つの迷路タスクであり、結果はハイパーパラメータによって変わる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

強化学習によるポストトレーニングは言語モデルエージェント構築の標準工程になったが、実行は厄介だ。モデルが軌跡を生成し、報酬を受け取り、ポリシーを更新する。それを複数ノードで行えば、1回の学習で数百GPU時間分のロールアウトが発生する。AWSは核心的な課題を、長時間ジョブを維持し、ハードウェア障害から進捗を失わずに復旧し、可観測性を保つインフラと位置づける。

SageMaker HyperPodはそれに対するAWSの答えであり、このウォークスルーではオープンソースRLフレームワークのSkyRLと組み合わせている。迷路タスクは意図的に単純だ。エージェントは2D迷路の画像を見て方向を選ぶか停止し、移動制限内にゴールへ到達したときだけ報酬を得る。一手ごとの解答キーがないため、SkyRLのGRPOは各開始位置で複数回実行し、それらを相互採点してグループ平均を上回るものを強化する。別のクリティックや価値モデルなしで機能するシグナルだ。HyperPod上では推論エンジンと学習シャードが同じGPUを共有し、更新されたLoRA重みは各オプティマイザステップ後にAmazon FSx for Lustre経由で同期される。

見出しの数字にはAWS自身が付けた注意点がある。結果はハイパーパラメータと迷路構成によって変わる。このウォークスルーが本当に示すのは配管部分だ。チェックポイント、ノード交換、sagemaker_ray://プロトコルでのジョブ投入、事前構築済みGrafanaダッシュボード。実用的な価値は、チームがこの組み合わせを自らのより長く複雑なRL実行に信頼できるかどうかにかかっている。すでにGPUクラスタを持つチームは乗り換える理由をほとんど見出さないかもしれない。そのハードウェアなしでポストトレーニングを拡大するチームが主な対象だろう。

よくある質問
このウォークスルーにはどのようなハードウェアが必要か?
AWSの投稿によると、GPUワーカーノード3台(各2基のNVIDIA RTX PRO 6000 Blackwell GPU、合計6基)のml.g7e.12xlargeと、512 GB RAMを搭載したCPUヘッドノード1台のml.r5d.16xlargeを使用した。
なぜヘッドノードにそんなに多くのメモリが必要なのか?
チェックポイント保存のたびにGPUワーカーからLoRAアダプタのシャードを統合し、アダプタの全重みを一時的にCPUメモリに読み込むため、AWSは512 GB RAMのml.r5d.16xlargeを選んだ。
推論用に実際にデプロイするものは何か?
成果物は完全なモデルではなくLoRAアダプタだ。Ray ServeがAmazon S3などのクラウドストレージパスからオンデマンドで読み込み、アダプタのサブディレクトリ名がリクエスト時に使う名前になる。
Amazon AI Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Copilotアプリにワークフローキャンバス追加GitHub Copilot Blog · 3時間前
  • AstraとClaude Opus 5がエニグマ解読TechCrunch AI · 3時間前
  • MetaのMuse、ChatGPT初期を上回る勢いかTechCrunch AI · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へProactionのColin Knudsen、Codexでデモを自作し成約率を50%から60%に向上