AIToday

Black Forest Labs、画像・動画・音声・ロボット制御を統合したFLUX 3発表

Latent Space3時間前
Black Forest Labs、画像・動画・音声・ロボット制御を統合したFLUX 3発表

要点

Black Forest LabsがFLUX 3を発表しました。画像・動画・音声・ロボット行動予測を統合するマルチモーダルモデルで、テキストや画像から動画を生成し、複数言語対話や多彩なスタイル出力に対応します。FLUX-mimicはこのモデルをロボット制御に応用したもので、より優れた動画世界モデルがロボット学習効率を向上させることを示唆しており、実工場での検証も開始されています。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Black Forest LabsがFLUX 3を発表しました。画像、動画、音声、行動予測を1つの統合アーキテクチャで扱うマルチモーダルモデルで、テキスト・画像からの動画生成、動画の継続・参照、マルチリンガル対話、複数スタイルの出力に対応しています。同時にFLUX-mimicも発表し、ロボット企業mimicと協力してFLUX 3をロボット制御に応用できることを示しました。

  • なぜ重要か

    これまで画像や動画、音声は別々のモデルで扱われることが多かったのに対し、FLUX 3は1つの訓練済みアーキテクチャで複数の生成タスクと制御タスクを統合しています。FLUX-mimicの例からは、優れた動画の世界モデルがロボット制御の質と学習効率に直結する可能性が示唆されており、実工場での検証も進んでいるとみられます。

  • 注目点

    FLUX 3 Videoはすでに早期アクセス段階で利用可能です。オープンウェイト版の開発者向けバージョンも予定されており、独立した研究機関による最先端性能の再現として業界で注目を集めています。

詳細

Black Forest Labs(BFL)は7月23日、マルチモーダル生成・制御モデル「FLUX 3」を発表しました。このモデルは、テキスト・画像からの動画生成、動画の継続(「アニメーション」)や視覚的参照としての使用、動画から動画への変換、入力動画と音声からの生成継続、キーフレーム指定による制御された遷移、マルチリンガル対話に対応しています。さらに複数のスタイル範囲(キャンディッドなカメラ映像からアニメーション・シネマティクスまで)、強力な文字生成、複数ショット動画への自動チェーニングなど、広範な機能を備えています。

FLUX 3は統一アーキテクチャで訓練されており、音声生成もネイティブに統合されています。自動チェーニング機能により、個別クリップを組み合わせて長尺・複数ショットの映像を生成できます。これらの機能の多くは他の最先端モデルに見られるものでありながら、BFLの独立した再現として業界から注目を集めています。

同社はさらにFLUX3-mimicも発表しました。これはロボット企業mimicroboticsとの協業で、FLUX 3のバックボーンにmimicのロボット学習専門知識を組み合わせた動画・行動モデルです。ロボット・ウェアラブルデータで訓練され、1つのオンプレミスGPUで実行可能な汎用の器用性制御モデルです。mimicとBFLの中心的主張は、より優れた動画の世界モデリングがロボット制御の品質とサンプル効率に直結するというもので、既にAudiとの実工場試験が進行中です。

これらのリリースは、単一の統一アーキテクチャが複数の異なるメディア生成タスクと物理的制御タスクの両方を処理できることを示しており、生成AI と具体的なロボット応用の融合を象徴する展開となっています。

背景と解説

Black Forest Labsは2024年にFlux 1を発表して以来、動画モデルへの展開を予告していました。FLUX 3の発表はその約2年後の実現です。同モデルの中核となっているのは、Self Flowと呼ばれる統一アーキテクチャで、複数のモーダル(画像・動画・音声・行動)を単一の訓練フレームワークで扱う設計です。

このアプローチの意味は、モーダル間の転移学習を活かせることにあります。FLUX-mimicの開発では、改良された動画の世界モデルがロボット制御の品質と学習効率に直結する、という仮説が検証されつつあります。mimicロボティクスとの協業とAudiでの実工場試験は、この統合モデルが実運用に耐える水準に達していることを示唆しており、業界内で「独立した最先端技術の再現」と位置付けられています。

よくある質問

FLUX 3 Videoはいつから使えますか?
FLUX 3 Videoは現在早期アクセス段階で利用可能です。また、オープンウェイト版の開発者向けバージョンも予定されています。
FLUX-mimicは何ですか?
FLUX-mimicはロボット企業mimicがFLUX 3を基に開発した動画・行動モデルで、ロボット・ウェアラブル学習データで訓練され、1つのオンプレミスGPUで動作する汎用器用性の高いロボット制御モデルです。すでにAudiとの試験が進んでいます。

「画像生成」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます