
ドイツ・フライブルク拠点のAIラボBlack Forest Labsは、単一のプロンプトから画像と20秒までの動画(音声付き)を生成するマルチモーダルモデル「FLUX 3」をリリースした。画像、動画、音声システムを別々に組み合わせるモデルとは異なり、FLUX 3はこれら3つのモダリティ全体で統合的に学習され、ロボットビジョンと動作にも拡張される。同社初の公開動画生成モデルであり、クリエイティブ生成とロボティクスを単一の「ビジュアルインテリジェンス」機能の関連アプリケーションとして扱う方針へのシフトを示している。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
Black Forest Labsは、画像と20秒までの動画・音声クリップを単一のプロンプトから生成するマルチモーダルAIモデル「FLUX 3」をリリースした。このモデルは画像、動画、音声を別々に組み合わせるのではなく、統合的に学習されており、ロボットビジョンと動作にも拡張される。
なぜ重要か
FLUX 3は同社初の公開動画生成モデルであり、クリエイティブ生成、シミュレーション、コンピュータ利用、ロボティクスを単一の機能の関連アプリケーションとして位置付けている。Black Forest Labsはこれを「ビジュアルインテリジェンス」と呼び、各モダリティを独立したツールではなく、物理的・デジタル環境全体で認識、予測、行動できるモデルとして提示している。
注目点
FLUX 3は4つの製品ラインを通じて提供される。FLUX 3 Video、FLUX 3 Image、FLUX 3 Actが含まれる。リリースは限定的な展開となるため、今後より広範な利用可能性や価格設定の詳細が明かされる可能性がある。
ドイツ・フライブルク拠点のAIラボBlack Forest Labsは本日、FLUX 3をお披露目した。これは初期の画像焦点型FLUXラインを大きく超える拡張を示す、マルチモーダルフロンティアモデルである。FLUX 3は画像の理解と生成、および単一のプロンプトからの20秒までの動画・音声の組み合わせ生成に学習されている。重要なのは、同社がFLUX 3は画像、動画、音声のモダリティ全体で統合的に学習されており、1つのインターフェースの下で事前構築された個別モデルを組み合わせるのではないことを強調している点である。このアーキテクチャの選択は、クリエイティブ生成、シミュレーション、コンピュータ利用、ロボティクスが単一の基盤となる機能の関連アプリケーションとして理解されるべきであるというBlack Forest Labsの企業向けコアメッセージの基盤となっている。同社はこれを「ビジュアルインテリジェンス」と呼び、物理的・デジタル環境の両方で認識、予測、行動できるモデルを指している。このリリースはBlack Forest Labs初の公開動画生成モデルでもある。FLUX 3は4つの製品ラインを通じて提供される。FLUX 3 Video、FLUX 3 Image、FLUX 3 Actが含まれる。初期リリースは限定的であり、同社は即座の広範な展開ではなく段階的なアクセス展開を行っていることを示している。
Black Forest Labsは、マルチモーダルAIを支配してきたモジュール型アプローチからの脱却としてFLUX 3を位置付けている。独立した画像、動画、音声ジェネレーターを構築して組み合わせるのではなく、同社は3つすべてのドメインにわたって単一のアーキテクチャを統合的に学習した。この設計選択は、画像生成、動画作成、音声合成、ロボット知覚、ロボット制御を「ビジュアルインテリジェンス」と呼ぶ統一された機能の現れと見なす、より広い战略的ビジョンを反映している。このフレーミングは、企業がこれらの従来は独立したアプリケーションを相互に関連したものとして考えるべきであることを示唆しており、単一モデルが物理的・デジタルの両方の文脈で知覚と行動を扱う新しいワークフローを開く可能性がある。限定的な初期リリースは、同社がフィードバック収集と性能検証の後で本格展開する前に、慎重にロールアウトを管理していることを示唆している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます
毎朝1分、AIの要点だけ。
200媒体以上・Email/LINE/Slack 対応