AIToday
動画生成大規模言語モデルTHE DECODER掲載日時: 2026年7月19日 22:015分で読める

Google DeepMindのビデオ生成モデルが少量データで視覚認識タスク解決

LINEで送る
Google DeepMindのビデオ生成モデルが少量データで視覚認識タスク解決

3つのポイント

  1. 何が起きたか

    Google DeepMindが GenCeption をリリースした。事前学習済みのビデオ生成モデル(アリババの Wan2.1)を流用し、奥行き推定、セグメンテーション、3次元姿勢推定などのコンピュータビジョンタスクを単一フォワードパスで実行する。DepthAnything 3(奥行き)、NormalCrafter と Lotus-2(表面法線)、Genmo と TRAM(3次元姿勢)などの専門特化型モデルと同等かそれ以上の精度を達成しながら、合成データ中心の7,500本のビデオのみで、従来比で7~500倍少ないデータで学習している。

  2. なぜ重要か

    コンピュータビジョンは従来、各タスク専用の独立したモデルに依存してきた。これは言語処理とは異なり、言語処理では1つの汎用モデルが多くの機能を処理する。GenCception の成功は、ビデオ生成器がすでに空間、運動、物理についての共有された内部表現を保有していることを示唆している。このような表現は複数のビジョンタスクに活用できる。これは大規模言語モデルが自然言語処理で果たす役割に匹敵するコンピュータビジョン向けの基盤モデル・アプローチを示唆しており、カスタムアーキテクチャと膨大なラベル付きデータセットの必要性を削減する可能性がある。

  3. 注目点

    GenCception の汎化能力は強いが不均一である。合成シングルパーソンビデオのみで学習したにもかかわらず、実ビデオおよび未知のカテゴリ(動物、人型ロボット)への転移性能は優れており、ひげや個別の毛髪といった細部も保持している。しかし、複数タスクの同時学習時には3次元キーポイント推定の性能が低下し、処理速度も遅い(モデルサイズに応じて81フレーム動画で6~10秒)。また、本手法には異論もある。ピクセル予測型ビデオモデルが本当に有用なワールドモデルを含んでいるかについて研究者間で議論があり、元Meta AI科学者 Yann LeCun を含む専門家らは生成型ビデオは行き止まりだと主張している。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

コンピュータビジョンは歴史的にセグメンテーション、奥行き推定、表面法線、姿勢認識など、各タスク用の専門特化型モデルに細分化されてきた。各アーキテクチャは狭い領域に最適化されている。一方、言語処理分野は統一された訓練シグナルを持ち、それが大規模言語モデルの汎用性を生み出した。次の単語を予測することが、文法、世界知識、関係性を吸収する強力な汎用目的として機能することが判明した。GenCception はビデオ生成が視覚領域でも同様の役割を果たす可能性を示唆している。現実的なビデオ生成には、空間幾何、物体の運動、基本的な物理の学習が必要である。こうした表現はビデオ合成をはるかに超えて有用であることが判明した。アリババのオープンソース Wan2.1 モデルを基盤とし、そのアーキテクチャを簡素化(反復拡散プロセスを単一フォワードパスに置き換え)することで、研究者たちはこれらの学習特性が、はるかに多くのラベル付きデータで学習した専門特化型システムを上回ることができることを実証した。テキストプロンプトを用いてどのタスクを実行するかを指定し、統一された出力表現(すべての結果を標準3チャネル RGB 画像として表現)を採用する手法は、大規模言語モデルの指示追従パラダイムをさらに反映している。

ただし、ビデオ生成器が真のワールドモデルを含むという主張は依然として異論がある。国際研究チームがワールドモデルの正式な定義を提案し、テキスト・ツー・ビデオモデルを明示的に除外した。実世界からのフィードバックが欠落していることを理由とした。元Meta最高AI科学者 Yann LeCun は、ピクセル予測型ビデオモデルは根本的に制限されていると主張している。清華大学のベンチマークは、Sora 2、Seedance 2.0、Veo 3.1 が基本的な物理および論理テストで繰り返し失敗したことを示した。視覚的には説得力のある出力であっても同様である。GenCception はこの議論を迂回している。ビデオ生成を、モデルが世界の動作を予測することを求めるのではなく、特定のタスク用の学習特性抽出という狭い目的で使用している。結果として、明示的な物理理解がなくても、ビデオ生成時に学習された表現には十分な空間・運動情報が含まれており、従来のアプローチよりも効率的に密な予測タスクを解決できることが示された。

よくある質問
GenCception は他のモデルと比べてどの程度のトレーニングデータを使用したか
GenCception は7,500本の合成ビデオ(800個のデジタルヒューマンモデルと200個のモーションキャプチャシーケンスを Blender でレンダリングしたもの)のみで学習し、数百万本のビデオで学習した D4RT や VGGT Omega などのモデルと同等の結果を達成した。ベンチマークに応じて7~500倍少ないデータで学習している。
GenCception はほぼ合成データで学習したのに実映像で機能するか
はい。GenCception は合成シングルパーソンビデオのみで学習したにもかかわらず、実ビデオおよび動物や人型ロボットのような未知のカテゴリへの汎化性能に優れている。また、一部の出力はトレーニングに使用した Blender レンダリングよりも細かい詳細(ひげ、個別の毛髪)を保持している。
GenCception の動画処理速度はどの程度か
小型モデルは81フレーム動画の処理に約6秒かかり、大型モデル(140億パラメータ)は約10秒かかる。
LINEで送る

「動画生成」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • World Labs、写真数枚から3D世界を生成するAI「Atlas」発表THE DECODER · 5日前
  • World Labsが空間AIモデルAtlasを発表ITmedia AI+ · 5日前
  • Viskoが1000万ドル調達、ライブAI動画モデル「Orbis」公開SiliconANGLE AI · 6日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へヒューマノイドロボット産業、AI技術より人間操作に依存