
何が起きたか
Google DeepMindが GenCeption をリリースした。事前学習済みのビデオ生成モデル(アリババの Wan2.1)を流用し、奥行き推定、セグメンテーション、3次元姿勢推定などのコンピュータビジョンタスクを単一フォワードパスで実行する。DepthAnything 3(奥行き)、NormalCrafter と Lotus-2(表面法線)、Genmo と TRAM(3次元姿勢)などの専門特化型モデルと同等かそれ以上の精度を達成しながら、合成データ中心の7,500本のビデオのみで、従来比で7~500倍少ないデータで学習している。
なぜ重要か
コンピュータビジョンは従来、各タスク専用の独立したモデルに依存してきた。これは言語処理とは異なり、言語処理では1つの汎用モデルが多くの機能を処理する。GenCception の成功は、ビデオ生成器がすでに空間、運動、物理についての共有された内部表現を保有していることを示唆している。このような表現は複数のビジョンタスクに活用できる。これは大規模言語モデルが自然言語処理で果たす役割に匹敵するコンピュータビジョン向けの基盤モデル・アプローチを示唆しており、カスタムアーキテクチャと膨大なラベル付きデータセットの必要性を削減する可能性がある。
注目点
GenCception の汎化能力は強いが不均一である。合成シングルパーソンビデオのみで学習したにもかかわらず、実ビデオおよび未知のカテゴリ(動物、人型ロボット)への転移性能は優れており、ひげや個別の毛髪といった細部も保持している。しかし、複数タスクの同時学習時には3次元キーポイント推定の性能が低下し、処理速度も遅い(モデルサイズに応じて81フレーム動画で6~10秒)。また、本手法には異論もある。ピクセル予測型ビデオモデルが本当に有用なワールドモデルを含んでいるかについて研究者間で議論があり、元Meta AI科学者 Yann LeCun を含む専門家らは生成型ビデオは行き止まりだと主張している。
こういう要約が、毎朝あなたのメールに届きます。
コンピュータビジョンは歴史的にセグメンテーション、奥行き推定、表面法線、姿勢認識など、各タスク用の専門特化型モデルに細分化されてきた。各アーキテクチャは狭い領域に最適化されている。一方、言語処理分野は統一された訓練シグナルを持ち、それが大規模言語モデルの汎用性を生み出した。次の単語を予測することが、文法、世界知識、関係性を吸収する強力な汎用目的として機能することが判明した。GenCception はビデオ生成が視覚領域でも同様の役割を果たす可能性を示唆している。現実的なビデオ生成には、空間幾何、物体の運動、基本的な物理の学習が必要である。こうした表現はビデオ合成をはるかに超えて有用であることが判明した。アリババのオープンソース Wan2.1 モデルを基盤とし、そのアーキテクチャを簡素化(反復拡散プロセスを単一フォワードパスに置き換え)することで、研究者たちはこれらの学習特性が、はるかに多くのラベル付きデータで学習した専門特化型システムを上回ることができることを実証した。テキストプロンプトを用いてどのタスクを実行するかを指定し、統一された出力表現(すべての結果を標準3チャネル RGB 画像として表現)を採用する手法は、大規模言語モデルの指示追従パラダイムをさらに反映している。
ただし、ビデオ生成器が真のワールドモデルを含むという主張は依然として異論がある。国際研究チームがワールドモデルの正式な定義を提案し、テキスト・ツー・ビデオモデルを明示的に除外した。実世界からのフィードバックが欠落していることを理由とした。元Meta最高AI科学者 Yann LeCun は、ピクセル予測型ビデオモデルは根本的に制限されていると主張している。清華大学のベンチマークは、Sora 2、Seedance 2.0、Veo 3.1 が基本的な物理および論理テストで繰り返し失敗したことを示した。視覚的には説得力のある出力であっても同様である。GenCception はこの議論を迂回している。ビデオ生成を、モデルが世界の動作を予測することを求めるのではなく、特定のタスク用の学習特性抽出という狭い目的で使用している。結果として、明示的な物理理解がなくても、ビデオ生成時に学習された表現には十分な空間・運動情報が含まれており、従来のアプローチよりも効率的に密な予測タスクを解決できることが示された。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
エヌビディアのジェンスン・フアンCEOは、OpenAIが最新モデル「GPT-6 Astra」を発表したことを受け、汎用人工知能(AGI)が到来したと述べた

サウジアラビア政府系AI企業HUMAINは、CEOタレク・アミン氏の下でオープンAIモデルの中立的ハブとしての地位を確立し、米国・中国に続くAI超大国を目指している

アリババの研究部門がQwen-Drive 1.0を公開

開発者がChatGPTに対し、同じリモートワークのシナリオを被験者の性別と役職だけ変えて判定させた

Google DeepMindは、Gemini 3.1 Proを使う100の自律型LLMエージェントに71問の数学問題を解かせた

福島県は2025年度、2つの生成AIサービス(NTT東日本の提供サービスとMicrosoft 365 Copilot)について、有償アカウントを各50ずつ、計100アカウント用意し、約50人の職員を対象に実証実験を行った
