AIToday
画像生成動画生成ロボティクスLatent Space掲載日時: 2026年7月24日 16:00

Black Forest Labs、画像・動画・音声・ロボット制御を統合したFLUX 3発表

LINEで送る
Black Forest Labs、画像・動画・音声・ロボット制御を統合したFLUX 3発表

3つのポイント

  1. 何が起きたか

    Black Forest LabsがFLUX 3を発表しました。画像、動画、音声、行動予測を1つの統合アーキテクチャで扱うマルチモーダルモデルで、テキスト・画像からの動画生成、動画の継続・参照、マルチリンガル対話、複数スタイルの出力に対応しています。同時にFLUX-mimicも発表し、ロボット企業mimicと協力してFLUX 3をロボット制御に応用できることを示しました。

  2. なぜ重要か

    これまで画像や動画、音声は別々のモデルで扱われることが多かったのに対し、FLUX 3は1つの訓練済みアーキテクチャで複数の生成タスクと制御タスクを統合しています。FLUX-mimicの例からは、優れた動画の世界モデルがロボット制御の質と学習効率に直結する可能性が示唆されており、実工場での検証も進んでいるとみられます。

  3. 注目点

    FLUX 3 Videoはすでに早期アクセス段階で利用可能です。オープンウェイト版の開発者向けバージョンも予定されており、独立した研究機関による最先端性能の再現として業界で注目を集めています。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Black Forest Labsは2024年にFlux 1を発表して以来、動画モデルへの展開を予告していました。FLUX 3の発表はその約2年後の実現です。同モデルの中核となっているのは、Self Flowと呼ばれる統一アーキテクチャで、複数のモーダル(画像・動画・音声・行動)を単一の訓練フレームワークで扱う設計です。

このアプローチの意味は、モーダル間の転移学習を活かせることにあります。FLUX-mimicの開発では、改良された動画の世界モデルがロボット制御の品質と学習効率に直結する、という仮説が検証されつつあります。mimicロボティクスとの協業とAudiでの実工場試験は、この統合モデルが実運用に耐える水準に達していることを示唆しており、業界内で「独立した最先端技術の再現」と位置付けられています。

よくある質問
FLUX 3 Videoはいつから使えますか?
FLUX 3 Videoは現在早期アクセス段階で利用可能です。また、オープンウェイト版の開発者向けバージョンも予定されています。
FLUX-mimicは何ですか?
FLUX-mimicはロボット企業mimicがFLUX 3を基に開発した動画・行動モデルで、ロボット・ウェアラブル学習データで訓練され、1つのオンプレミスGPUで動作する汎用器用性の高いロボット制御モデルです。すでにAudiとの試験が進んでいます。
Latent Space元記事を読む
LINEで送る

「画像生成」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • 鈴木修氏の語録がかるたに、イラストはAITop Companies AI · 5時間前
  • OpenAI、Glass Imagingを3億ドル超で買収TechCrunch AI · 6時間前
  • 日立、画像AI処理時間を半減Top Companies AI · 1日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へCodex Slides、数分でスライド自動生成