
Black Forest Labsがマルチモーダル基盤モデル「Flux 3」を公開し、AI動画生成に初めてネイティブ音声機能を統合しました。画像・動画・音声を統合学習することで、Luma Ray 3.2やRunway Gen-4.5など複数の競合製品との比較で高い優位性を示しており、動画生成の「世界モデル」開発を推し進める重要な一歩となります。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
ドイツのAI企業Black Forest Labs(BFL)が、画像・動画・音声を統合学習するマルチモーダル基盤モデル「Flux 3」を発表しました。動画に直接音声を付加する機能をAI動画生成では初めて実装し、最長20秒のクリップに対応しています。
なぜ重要か
BFLの初期評価では、Flux 3は10秒・720pの動画でLuma Ray 3.2に対して93%の比較で、Runway Gen-4.5に対して77%の比較で優位性を示しました。単一のモダリティでは現実を完全に捉えられないという考えに基づき、複数のモダリティを組み合わせることで、より正確な「世界モデル」の構築へ向かう動きの一環とみられます。
注目点
Flux 3 Videoは既に利用可能で、Flux 3 Imageは数週間以内のアーリーアクセス提供を予定しており、オープンウェイト版「Flux 3 Dev」の段階的公開も計画されています。また、Mimic Roboticsと協力開発した動画・行動予測モデル「Flux-mimic」はAudiの生産タスクで現在テスト中です。
Black Forest Labs(BFL)はドイツを拠点とするAI企業で、今回発表したFlux 3は画像・動画・音声を統合的に学習するマルチモーダル基盤モデルです。BFLはこれを「現実世界の視覚知能」への一歩と位置付けており、物理的・デジタル環境を「認知、予測、行動」できるモデルの開発を目指しています。
Flux 3の最大の特徴は、AI動画生成に初めてネイティブ音声機能を統合した点です。最長20秒のクリップに対応し、テキスト-動画、画像-動画、動画-動画、キーフレームベースの遷移、多言語対話、複数クリップをつなぐエージェント駆動リンク機能を備えています。特に人間の顔の表情表現と物理的事象に対応した音声生成が得意とされています。
BFLが公表した初期評価は10秒・720p解像度の動画を用いた比較検証に基づいています。Flux 3はLuma Ray 3.2との比較で93%、Runway Gen-4.5との比較で77%、Grok Imagine Videoとの比較で69%で優位性を示しました。一方、より強力な競合製品との比較では差が縮小し、Kling v3 Proとの比較で60%、Happy Horse v1との比較で59%、Happy Horse 1.1との比較で57%、Seedance 2.0およびGemini Omni Flashとの比較で各52%となっています。BFL自身、これらの結果は予備的なものであり、独立した第三者による検証はまだ利用可能ではないと述べています。
Flux 3は「Self-Flow」と呼ばれるBFLの手法に基づいており、1つのモデルが同時にコンテンツを生成・理解できるよう設計されています。マルチモーダル変換器(トランスフォーマー)は画像・動画・音声・行動を共通の内部表現に変換し、再び出力に変換する専用コンポーネントを備えています。特に行動予測コンポーネントはロボティクス応用の基盤となり、Mimic Roboticsとの協力によりAudiの生産タスクでテスト中の動画・行動モデル「Flux-mimic」へと発展しています。
BFLは段階的な展開を計画しており、Flux 3 Videoは既に利用可能、Flux 3 Imageは数週間以内のアーリーアクセス提供予定です。行動予測機能は初期段階では選別されたパートナー向けに提供される予定です。さらに、マルチモーダル基盤モデルのオープンウェイト版「Flux 3 Dev」の公開も予定されています。長期的には、認知・行動・言語予測を単一モデルで統合する次世代モデルの開発が進められています。
Black Forest Labsが発表したFlux 3は、画像・動画・音声を単一モデルで同時学習する「Self-Flow」アプローチに基づいています。BFLは、単一のモダリティでは現実を完全に捉えられないと指摘しており、画像は空間構造を、動画は時間的な変化を、音声は機械的事象と音の関連性を明らかにすることで、各モダリティが互いのギャップを埋める効果があると説明しています。
Flux 3はこうした統合学習による高い動画生成品質を示す一方、BFL自身が「結果は予備的」と述べており、独立した第三者による検証はまだ利用可能ではありません。既に公開されているSeedance 2.0やGemini Omni Flashといった既成の有力モデルとの競争関係が焦点となります。さらに、BFLは行動予測コンポーネントを備えており、Mimic Roboticsとの協力によるAudiでの生産タスク向けテストなど、ロボティクス応用への展開も進んでいます。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます
毎朝1分、AIの要点だけ。
200媒体以上・Email/LINE/Slack 対応