
AWSは継続的なPhysical AIモデル工場の構築法を紹介。SageMaker HyperPodでNVIDIA Cosmos 3を使用。
1つのモデルファミリーが生成、トレーニング、評価を処理。
ステージごとのGPUプール分離の必要性が減る。
何が起きたか
AWSは、Amazon SageMaker HyperPod上でNVIDIA Cosmos 3を使ったPhysical AIモデル工場の構築ガイドを公開した。コードはawsome-distributed-ai GitHubリポジトリにある。
なぜ重要か
Cosmos 3は生成、事後トレーニング、評価を1つのモデルに統合し、異なるモードで動作する。これにより、ロボットや自動運転車のチームは、ステージごとに別々のGPU容量を用意する代わりに、単一の永続的なGPUプールを使用できる。GPUグッドプット(予約済みGPU時間あたりの有用なパイプライン進捗)が向上し、これが実際のコスト要因であると投稿は指摘する。国内でロボットや自動運転車を開発する企業は、GPU利用効率が上がる手法を試せる可能性がある。
注目点
モデルファミリーには、Cosmos3-Nano(160億パラメータ)、Cosmos3-Super(640億パラメータ)、Cosmos3-Edge(デバイス展開向け40億パラメータ層)が含まれる。AWSは公開DROIDデータセットを使ったロボットポリシーステージを解説している。
このブログ投稿は、ロボティクスと自動運転開発における実際のボトルネック、つまり単一のトレーニングジョブではなく、継続的な改善ループを実行する必要性に対処している。従来、チームはデータ生成、事後トレーニング、評価の各ステージに対して別々のGPUクラスタを用意し、それぞれにセットアップとティアダウンのライフサイクルがあった。AWSはこれが容量を断片化し、予約済みGPU時間あたりの有用なパイプライン進捗であるGPUグッドプットを低下させると主張する。
Cosmos 3の設計はAWSの提案の中心にある。1つのモデルがフォワードダイナミクスのワールドモデル、インバースダイナミクスのアクションラベラー、展開可能なポリシーとして動作できるため、3つのステージすべてを単一の永続的なGPUプール上のワークロードとして実行できる。AWSはこれにより、再プロビジョニングの手順とステージ間のテラバイト規模のデータ移行が不要になると述べている。クラスタはAmazon SageMaker HyperPodとEKS上で実行され、全ステージがS3をバックエンドとする単一のAmazon FSx for Lustreファイルシステムを共有する。
投稿では、公開DROIDデータセットを使った完全なエンドツーエンドのロボットポリシーステージを、awsome-distributed-ai GitHubリポジトリの実行可能なコードとともに解説している。AWSは、GPU可用性とリードタイムの変動を避けるために、容量をループ全体にコミットすべきだと強調している。具体的には、期間が定められたキャンペーンには柔軟なトレーニングプランを、期間が定められていないものには容量予約を使用する。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
BEXCOのゼネラルマネージャー、トム・チェイ氏は、AIカメラやロボット、ドローン、予測システムが普及する韓国の安全技術分野は、トップダウンの力によって導入が進められていると主張する

米陸軍がPalantirを選び、AI搭載のTITANトラック8台を製造させることを決定(Axios報道)

美的はベルリンで開催されたIFA 2026で、AI搭載ホームエコシステム「SMART MASTER」を発表した

Lattice Semiconductorのセキュリティ事業担当バイスプレジデント、Eric Sivertson氏がThe Robot Report Podcastに出演し、FPGA(フィールドプログラマブルゲートアレイ…

エヌビディアは、AIホスティングプラットフォームのハグフェイスを129億ドルで買収すると発表した
Lyte AI Inc.はシリーズCで1億6500万ドルを調達し、物理AI企業としての評価額はポストマネーで16億ドルに達した
