AIToday

Google DeepMindのビデオ生成モデルが少量データで視覚認識タスク解決

THE DECODER17時間前
Google DeepMindのビデオ生成モデルが少量データで視覚認識タスク解決

要点

Google DeepMind の GenCception モデルは、ビデオ生成器をコンピュータビジョンタスク(奥行き推定、セグメンテーション、姿勢認識)の基盤モデルとして流用できることを示した。専門特化型モデルと比較して、7~500倍少ないトレーニングデータで最先端の結果を達成している。この知見は、コンピュータビジョンがタスク固有のアーキテクチャを必要とするという従来の前提に異議を唱えるもので、現実的なビデオ生成を学習することですでに複数のビジョンタスクに必要な空間的および物理的理解を習得していることを示唆している。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Google DeepMindが GenCeption をリリースした。事前学習済みのビデオ生成モデル(アリババの Wan2.1)を流用し、奥行き推定、セグメンテーション、3次元姿勢推定などのコンピュータビジョンタスクを単一フォワードパスで実行する。DepthAnything 3(奥行き)、NormalCrafter と Lotus-2(表面法線)、Genmo と TRAM(3次元姿勢)などの専門特化型モデルと同等かそれ以上の精度を達成しながら、合成データ中心の7,500本のビデオのみで、従来比で7~500倍少ないデータで学習している。

  • なぜ重要か

    コンピュータビジョンは従来、各タスク専用の独立したモデルに依存してきた。これは言語処理とは異なり、言語処理では1つの汎用モデルが多くの機能を処理する。GenCception の成功は、ビデオ生成器がすでに空間、運動、物理についての共有された内部表現を保有していることを示唆している。このような表現は複数のビジョンタスクに活用できる。これは大規模言語モデルが自然言語処理で果たす役割に匹敵するコンピュータビジョン向けの基盤モデル・アプローチを示唆しており、カスタムアーキテクチャと膨大なラベル付きデータセットの必要性を削減する可能性がある。

  • 注目点

    GenCception の汎化能力は強いが不均一である。合成シングルパーソンビデオのみで学習したにもかかわらず、実ビデオおよび未知のカテゴリ(動物、人型ロボット)への転移性能は優れており、ひげや個別の毛髪といった細部も保持している。しかし、複数タスクの同時学習時には3次元キーポイント推定の性能が低下し、処理速度も遅い(モデルサイズに応じて81フレーム動画で6~10秒)。また、本手法には異論もある。ピクセル予測型ビデオモデルが本当に有用なワールドモデルを含んでいるかについて研究者間で議論があり、元Meta AI科学者 Yann LeCun を含む専門家らは生成型ビデオは行き止まりだと主張している。

詳細

Google DeepMind の研究者らは GenCception を発表した。事前学習済みのビデオ生成システムを流用し、奥行き推定、表面法線予測、セグメンテーション、3次元姿勢認識などの古典的なコンピュータビジョンタスクに対応させるモデルである。核となるイノベーションはアーキテクチャの簡素化である。拡散モデルは通常、ノイズから出発する多くの小さな反復ステップを通じてビデオを生成するが、GenCception はすべての出力を単一フォワードパスで生成し、速度を劇的に向上させながら精度を保持している。

このモデルはアリババのオープンソース Wan2.1 ビデオジェネレータを基盤とし、テキストプロンプト経由でタスク指示を受け入れるよう適応させている。チャットボットが自然言語コマンドに応答する方法に類似している。各ビジョンタスク用に個別の専門特化型アーキテクチャを作成するのではなく、すべての出力を標準3チャネル RGB 画像として表現している。奥行きマップと表面法線はカラー画像としてエンコードされ、セグメンテーションマスクは画像のような表現、カメラ運動は画像として表現される。3次元キーポイント座標など、画像に自然にマッピングされない出力については、訓練可能なモジュールが追加される。単一の損失関数がすべてのタスク間で同時に訓練され、タスク固有の要件はネットワーク再設計ではなくトレーニングデータの前処理で処理される。

トレーニングデータはほぼすべて合成であり、わずか7,500本のビデオのみで構成されていた。研究チームは800個のデジタルヒューマンモデルと200個のモーションキャプチャシーケンスを組み合わせ、Blender でさまざまな背景とカメラアングルでレンダリングすることでこれらを合成した。言語ガイドセグメンテーションのみが実ビデオから引き出された。この最小限で人工的なトレーニングセットにもかかわらず、GenCception は複数のベンチマーク全体で最先端の結果と同等かそれ以上を達成した。その奥行き推定は DepthAnything 3 と同等であり、表面法線推定で NormalCrafter と Lotus-2 を上回り、3次元姿勢認識で Genmo と TRAM を上回り、複雑な言語ガイドセグメンテーションで Meta の SAM 3 と Gemini 3.5 Flash の組み合わせと同等である。D4RT や VGGT Omega などの他のモデルは数百万本のビデオで学習した。GenCception は7~500倍少ないデータを使用して同等の結果を達成している。同一条件下でテストした場合、ビデオ生成での事前学習は V-JEPA や VideoMAE V2 などのメソッドを上回った。これは、生成タスク自体(データ量だけではなく)が有用な空間表現を教えることを示唆している。

トレーニング分布を超えた汎化は特に顕著であった。GenCception はほぼ完全にシングルパーソン合成ビデオで訓練されたが、複数の人物、動物、人型ロボットを含む実映像を正常に処理した。これらのカテゴリはトレーニング中に遭遇したことはない。いくつかの場合において、モデルの出力はトレーニングに使用した Blender レンダリングよりも多くの詳細を含んでいた。猫のひげと個別の毛髪を保持している。ただし、すべてのタスク間の同時学習はパフォーマンスが低下した。3次元キーポイント推定の場合、そのタスクに必要な追加モジュールがベースモデルがビデオ事前学習中に学習したメカニズムを妨害したと考えられる。研究者らは、元のモデルへのアーキテクチャの最小限の変更が最良の結果をもたらすと結論付けている。処理速度は依然として制約である。小型モデルは81フレーム動画の処理に約6秒必要であり、大型の140億パラメータバリアントは約10秒必要である。

著者らは、これらの結果がビデオ生成器がすでに普遍的なワールドモデルの一種——空間、運動、物体幾何についての内部表現——を含んでいることを実証していると主張している。大規模言語モデルがテキストに果たす役割と同様に、これはコンピュータビジョンの基盤として機能する可能性がある。この主張は異議を唱えられている。国際研究チームがワールドモデルの正式な定義を確立し(OpenWorldLib)、テキスト・ツー・ビデオジェネレータを明示的に除外した。実世界フィードバックの欠落を理由としている。元Meta最高AI科学者 Yann LeCun はさらに進み、生成型ビデオモデルは行き止まりだと主張している。Meta の代替アプローチである V-JEPA 2 はピクセルではなく抽象的な概念を予測する。清華大学のベンチマークは基本的な制限を記述した。Sora 2、Seedance 2.0、Veo 3.1 は視覚出力が説得力のあるものであっても、基本的な物理および論理テストで繰り返し失敗した。GenCception の貢献はより限定的だがより実用的である。研究者は、ビデオ生成から学習された特性を特定の明確に定義されたタスク(奥行き、セグメンテーション、姿勢)抽出し、そこで専門特化型システムを上回る。Google DeepMind は、インタラクティブな3次元環境を構築するために AI エージェントをトレーニングする Genie 3 で補完的な方向を模索している。

背景と解説

コンピュータビジョンは歴史的にセグメンテーション、奥行き推定、表面法線、姿勢認識など、各タスク用の専門特化型モデルに細分化されてきた。各アーキテクチャは狭い領域に最適化されている。一方、言語処理分野は統一された訓練シグナルを持ち、それが大規模言語モデルの汎用性を生み出した。次の単語を予測することが、文法、世界知識、関係性を吸収する強力な汎用目的として機能することが判明した。GenCception はビデオ生成が視覚領域でも同様の役割を果たす可能性を示唆している。現実的なビデオ生成には、空間幾何、物体の運動、基本的な物理の学習が必要である。こうした表現はビデオ合成をはるかに超えて有用であることが判明した。アリババのオープンソース Wan2.1 モデルを基盤とし、そのアーキテクチャを簡素化(反復拡散プロセスを単一フォワードパスに置き換え)することで、研究者たちはこれらの学習特性が、はるかに多くのラベル付きデータで学習した専門特化型システムを上回ることができることを実証した。テキストプロンプトを用いてどのタスクを実行するかを指定し、統一された出力表現(すべての結果を標準3チャネル RGB 画像として表現)を採用する手法は、大規模言語モデルの指示追従パラダイムをさらに反映している。

ただし、ビデオ生成器が真のワールドモデルを含むという主張は依然として異論がある。国際研究チームがワールドモデルの正式な定義を提案し、テキスト・ツー・ビデオモデルを明示的に除外した。実世界からのフィードバックが欠落していることを理由とした。元Meta最高AI科学者 Yann LeCun は、ピクセル予測型ビデオモデルは根本的に制限されていると主張している。清華大学のベンチマークは、Sora 2、Seedance 2.0、Veo 3.1 が基本的な物理および論理テストで繰り返し失敗したことを示した。視覚的には説得力のある出力であっても同様である。GenCception はこの議論を迂回している。ビデオ生成を、モデルが世界の動作を予測することを求めるのではなく、特定のタスク用の学習特性抽出という狭い目的で使用している。結果として、明示的な物理理解がなくても、ビデオ生成時に学習された表現には十分な空間・運動情報が含まれており、従来のアプローチよりも効率的に密な予測タスクを解決できることが示された。

よくある質問

GenCception は他のモデルと比べてどの程度のトレーニングデータを使用したか
GenCception は7,500本の合成ビデオ(800個のデジタルヒューマンモデルと200個のモーションキャプチャシーケンスを Blender でレンダリングしたもの)のみで学習し、数百万本のビデオで学習した D4RT や VGGT Omega などのモデルと同等の結果を達成した。ベンチマークに応じて7~500倍少ないデータで学習している。
GenCception はほぼ合成データで学習したのに実映像で機能するか
はい。GenCception は合成シングルパーソンビデオのみで学習したにもかかわらず、実ビデオおよび動物や人型ロボットのような未知のカテゴリへの汎化性能に優れている。また、一部の出力はトレーニングに使用した Blender レンダリングよりも細かい詳細(ひげ、個別の毛髪)を保持している。
GenCception の動画処理速度はどの程度か
小型モデルは81フレーム動画の処理に約6秒かかり、大型モデル(140億パラメータ)は約10秒かかる。

こうしたAIニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

この記事のディスカッションはまだありません

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます

毎朝1分、AIの要点だけ。

200媒体以上・Email/LINE/Slack 対応

無料で受け取る →