AIToday
大規模言語モデル画像生成動画生成THE DECODER掲載日時: 2026年9月2日 22:004分で読める

World Labs、写真数枚から3D世界を生成するAI「Atlas」発表

LINEで送る
World Labs、写真数枚から3D世界を生成するAI「Atlas」発表

要点

  • World Labsが数枚の写真から3D世界を生成するAIモデル「Atlas」を発表。

  • 動画生成やシーン再構築、ロボット向けシミュレーションを実現する。

3つのポイント

  1. 何が起きたか

    World Labsが、テキスト・画像・動画・3Dデータで学習し、各入力を3D空間内の特定位置に紐付けるオムニモデル「Atlas」を発表。ユーザーが操作するカメラ経路で最大1分間の1440p動画を生成できるほか、2〜3枚の写真から実シーンを再構築し、100以上の入力も処理可能。

  2. なぜ重要か

    2025年11月に李飛飛氏が指摘した課題、すなわち現在のマルチモーダル・動画モデルはデータを1D・2Dの系列に分解するため単純な空間タスクが不必要に難しくなるという問題に、Atlasは対応。共有された空間理解により純粋な言語・動画モデルと一線を画し、人間による評価では専用モデルを上回り、MiniMax H3に対して75%、Seedance 2.5に対して94%で勝利。国内の映像制作やロボット関連企業では、写真からの3D空間生成による業務効率化が進む可能性がある。

  3. 注目点

    Atlasのネイティブ3D出力はポイントクラウドと3Dガウシアンスプラットに対応し、Marbleの表現と一致。また、2026年8月に実証された、5つのロボットプラットフォームで各1時間、人間の介入なしに稼働したreal-to-sim-to-realエンジンを基盤に、ロボティクス向けの実物からシミュレーションへのツールとしても機能する。Atlasは現在、一部パートナー向けに早期アクセスプログラムを提供中。

この記事についてAIに質問する →

背景と解説

World Labsは2024年、ImageNetを創設しGoogle CloudのAI部門を率いた李飛飛氏によって設立された。同社の軌跡は、限られた初期システムからより高性能な製品への進化を示している。2024年末の初代システムは仮想的な移動が数メートルに限られていたが、2025年11月にはMarbleが登場した。2026年2月にはAutodesk、Andreessen Horowitz、Nvidia、AMDから10億ドルの資金調達を実施し、Bloombergは評価額50億ドルでの交渉を報じていた。

Atlasは言語モデルと拡散技術の両方を基盤とし、KVキャッシングなどの高速化手法を可能にする言語モデルのように出力を断片的に生成する一方、拡散原理を用いて出力をノイズから徐々にフィルタリングする。このハイブリッドアプローチにより、ノイズ除去の短縮や画質向上の手法を利用できる。同社は、Atlasの能力を単一のベンチマークで捉えることはできず、カメラ制御生成と少数視点再構築の個別テストを参照している。

ロボティクス分野では、2026年8月に実証されたreal-to-sim-to-realエンジンを拡張する。これは、7月に買収したスタートアップSceniX由来で、実世界の単一タスクから数千のバリエーションを生成し、モデルを完全にシミュレーション内で訓練する。5つのロボットプラットフォームが人間の介入なしに各1時間稼働した。Atlasも同様に、部屋を再構築し、シミュレーション経路に沿ってセンサーデータを生成することで、物理的な状況をすべて撮影することなく多様な訓練データを生成することを目指す。同社は、スケールに応じて計算リソースを増やすことでAtlasの性能は向上すると見込んでおり、将来のMarbleや他製品に搭載される予定だ。

よくある質問

Atlasが他のAIモデルと異なる点は?
Atlasは入力をフラットな系列として処理するのではなく、各入力を3D空間内の特定位置に紐付けます。この空間的文脈により、数枚の写真から新しい視点の生成やシーンの再構築、ロボットタスクのシミュレーションが可能です。
少数の写真でAtlasは何ができる?
2〜3枚の画像だけで、Atlasは忠実な再構築結果を提供し、専用の3Dモデルを上回ります。また、スタンフォードのメインクアッドを2枚から25枚まで段階的に組み立てたように、100以上の入力も処理可能です。
直接比較テストでAtlasは他モデルと比べてどうか?
人間による評価では、MiniMax H3との比較で75%、Gemini Omni Flashで81%、Happy Horse 1.1で86%、Seedance 2.5で94%の割合でAtlasが好まれました。再構築では、中央値誤差25.3でPi3XやVGGT-Ω 1Bを上回ります。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • 有料俳優とAI脚本、反民主党動画ネットワーク発覚Semafor Tech · 4時間前
  • ICRAパネルが論文氾濫に警鐘Robohub · 4時間前
  • Gemini動画分析、トークン88%削減THE DECODER · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へNTTグループが物理AIクラウドを展開