動画生成
2026年7月29日

今日の要点
AI動画生成の技術は急速に進化しており、mimic roboticsとBlack Forest Labsがそれぞれロボット学習の効率化と多モーダル統合モデルで新しい地平を開いている一方で、Runwayのような企業は予期しないバグを創意的な機能として実装し、業界全体で実用性と創造性を両立させようとしています。一方で、AI生成動画の急速な普及に伴い、明示表示が進む中でも実動画への信頼性低下への懸念が高まっており、技術進展と社会的信頼のバランスが重要な課題となっています。
主要ニュース
- 1
mimic roboticsがAudiにFLUX-mimicを導入、ロボット学習時間を30時間から30分に短縮
mimic roboticsは、Black Forest LabsのFLUX 3ビデオモデルを使用して構築したVideo-Action ModelであるFLUX-mimicを発表した。これにより、ロボットは30時間以上ではなく、わずか30分のロボットデータから複雑な操作タスクを学習できるようになった。同社はすでにAudiと共にこのシステムを導入し、自動車製造における柔軟で精密な操作作業の自動化を進めている。 柔軟な部品と精密操作を伴う製造タスクは、数十年のロボティクス投資にもかかわらず、従来型のプログラムされたロボットセルは生産バリエーション対応の再エンジニアリングコストが高すぎるため、依然として手作業のままである。FLUX-mimicが静止画像ではなく物理ダイナミクスのビデオ理解から学習できる能力により、Audiのような工場は数か月のエンジニアリング努力なしに従来は対応不可能だったタスクを自動化でき、ロボットが従業員と繰り返しで身体的に負担の大きい作業に協働するスマートファクトリーというAudiのビジョンと一致している。
Audiの製造環境はすでにFLUX-mimicを柔軟な物体操作作業のテストと導入を行っており、Audiはこれを従来型ロボティクスでは不可能だったと述べている。このパートナーシップは、広範な統合オーバーヘッドなしに、実際の生産ラインで信頼性を持ってシステムが非構造化タスクに対応できることを実証することを目指している。
- 2
Runwayがバグを機能に変更 AI動画モデルの実装工夫
Runwayは、リアルタイム動画生成でAI生成アバターが画面中央からずれるバグに数週間対応していましたが、バックエンド修正ではなく、フロントエンド機能として問題を迂回する設計に転換しました。 Runwayの Ryan Phillips エンタープライズプロダクト責任者は VB Transform 2026 で、自社モデルを構築していない企業でも、Runway の開発・評価・リリース方法から学べる教訓があると指摘。実装の現実的な工夫は多くの企業に応用可能だと述べています。
Runway Characters はゼロレイテンシーでAI生成アバターとの双方向リアルタイム対話を実現する動画モデルです。同社は汎用の世界モデル構築を目指すアプライドAI研究企業です。
- 3
エゴセントリック映像の処理プラットフォームがローンチ、研究機関との提携を模索
スタートアップがエゴセントリック映像と空間映像のためのデータ準備(ETL)パイプラインを自動化するプラットフォームを構築した。このプラットフォームは、ロボティクスと視覚言語アクション(VLA)モデル開発向けに、生映像をモデル対応の出力に変換する。チームは研究機関と企業を公開募集し、無料でサービスをテストするよう呼びかけている。 物理AIとテレオペレーションシステムを構築するチームは現在、映像データの前処理に相当なGPU時間とエンジニアリングの労力を費やしており、このプラットフォームはまさにこのボトルネックを解消するよう設計されている。データパイプラインを上流で処理することで、計算リソースとエンジニアリングの工数がコアモデル開発に解放される。
この提供はフィードバックを提供する意思のある研究機関に限定されている。参加に関心のあるチームはコメントを投稿するか直接メッセージで連絡して、参加について協議するよう招待されている。価格設定、利用可能日、正式なローンチのタイムラインは記載されていない。
- 4
Midjourney、占星術アプリCo-Starを買収
画像・動画生成AIで知られるAIラボのMidjourneyが、ソーシャル占星術アプリCo-Starを買収した。買収条件は明らかにされていない。Co-Starの従業員約20人がMidjourneyに参加した。 Co-Starは月間約430万のアクティブユーザーを持ち、AIと人間による執筆でホロスコープと占星術の相性診断を生成している。この買収は、医療・スパ部門の構築に続き、Midjourneyが画像生成事業の中核を超えて消費者向けアプリへの展開を進めていることを示している。
Midjourneyは現在、主にDiscordを通じて運営されており、独立したアプリを持たない。Co-Starチームの消費者向けアプリ開発経験により、Midjourneyが独自のスタンドアロンアプリケーション開発を進める可能性が高い。
- 5
Black Forest Labs、画像・動画・音声・ロボット制御を統合したFLUX 3発表
Black Forest LabsがFLUX 3を発表しました。画像、動画、音声、行動予測を1つの統合アーキテクチャで扱うマルチモーダルモデルで、テキスト・画像からの動画生成、動画の継続・参照、マルチリンガル対話、複数スタイルの出力に対応しています。同時にFLUX-mimicも発表し、ロボット企業mimicと協力してFLUX 3をロボット制御に応用できることを示しました。 これまで画像や動画、音声は別々のモデルで扱われることが多かったのに対し、FLUX 3は1つの訓練済みアーキテクチャで複数の生成タスクと制御タスクを統合しています。FLUX-mimicの例からは、優れた動画の世界モデルがロボット制御の質と学習効率に直結する可能性が示唆されており、実工場での検証も進んでいるとみられます。
FLUX 3 Videoはすでに早期アクセス段階で利用可能です。オープンウェイト版の開発者向けバージョンも予定されており、独立した研究機関による最先端性能の再現として業界で注目を集めています。
- 6
AI動画は明記されても実動画への信頼を揺るがす
研究者らは100人の参加者を対象に2段階の研究を実施し、AI生成動画に接した人々と人間が作成した動画を視聴した対照群を比較した。AI接触グループその後、対照群と同じく人間が作成した動画を視聴したが、その後の動画の真正性への疑念が増大し、自らの判断への自信が低下し、知覚的な混乱が大きくなり、社会的つながりが弱くなったと報告した。これは合成コンテンツがAI生成であることが明確に開示されていたにもかかわらずのことである。 この知見は、AI生成動画に単に明記を付すだけでは、視聴者の実動画への信頼を損なうことを防げないことを示している。これは、視聴者が合成コンテンツの出典を知っていながらも、リアルな映像への心理的・知覚的影響が実動画視聴へと波及することを示唆している。プラットフォーム企業やコンテンツ制作者にとって、これは検知と開示を超えた戦略が必要であることを示し、人々が視覚メディアをどのように経験し信頼するかを守るための施策が求められることを意味している。
本研究は、デザインと政策のアプローチが、AI生成動画への接触が生み出す経験的・心理的影響に対処する必要があることを示唆している。本研究は2026年度のCHI Conference on Human Factors in Computing Systemsで発表された。
今後の注目点
AI動画生成技術の実用化が急速に進む中、Audiのような製造業での現実的な導入事例やRunway Charactersのようなリアルタイム対話型AIの進化に注目が集まっています。一方で、AI生成動画がもたらす心理的影響への対応やMidjourneyなど主要プレイヤーのスタンドアロンアプリ化の動向も、今後の市場展開を左右する重要なポイントとして追視していく必要があります。
情報ソース
- mimic robotics introduces ‘frontier video-action models’ to the factory floor at Audi
- Runway couldn't fix a bug in its AI video model, so it turned the bug into a feature
- [Showcase] Built a processing engine for egocentric video and looking for labs to test it out for free
- Midjourney acquired the astrology app Co-Star
- [AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
- Seeing Is Not Believing: Realistic AI Videos Disrupt Confidence in Real Videos
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Can an LLM make a feature-length movie on its own?
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- Runway launches AI model router as generative media gets crowded
このニュースを友達にシェア
気になりそうな人に、今日のまとめをそのまま送れます。
AITodayで毎日のAIニュースを無料で受け取る
200以上のAIソースを毎朝1分で。Email / LINE / Slack 配信。
無料で登録する