
何が起きたか
ドイツのAI企業Black Forest Labs(BFL)が、画像・動画・音声を統合学習するマルチモーダル基盤モデル「Flux 3」を発表しました。動画に直接音声を付加する機能をAI動画生成では初めて実装し、最長20秒のクリップに対応しています。
なぜ重要か
BFLの初期評価では、Flux 3は10秒・720pの動画でLuma Ray 3.2に対して93%の比較で、Runway Gen-4.5に対して77%の比較で優位性を示しました。単一のモダリティでは現実を完全に捉えられないという考えに基づき、複数のモダリティを組み合わせることで、より正確な「世界モデル」の構築へ向かう動きの一環とみられます。
注目点
Flux 3 Videoは既に利用可能で、Flux 3 Imageは数週間以内のアーリーアクセス提供を予定しており、オープンウェイト版「Flux 3 Dev」の段階的公開も計画されています。また、Mimic Roboticsと協力開発した動画・行動予測モデル「Flux-mimic」はAudiの生産タスクで現在テスト中です。
こういう要約が、毎朝あなたのメールに届きます。
Black Forest Labsが発表したFlux 3は、画像・動画・音声を単一モデルで同時学習する「Self-Flow」アプローチに基づいています。BFLは、単一のモダリティでは現実を完全に捉えられないと指摘しており、画像は空間構造を、動画は時間的な変化を、音声は機械的事象と音の関連性を明らかにすることで、各モダリティが互いのギャップを埋める効果があると説明しています。
Flux 3はこうした統合学習による高い動画生成品質を示す一方、BFL自身が「結果は予備的」と述べており、独立した第三者による検証はまだ利用可能ではありません。既に公開されているSeedance 2.0やGemini Omni Flashといった既成の有力モデルとの競争関係が焦点となります。さらに、BFLは行動予測コンポーネントを備えており、Mimic Roboticsとの協力によるAudiでの生産タスク向けテストなど、ロボティクス応用への展開も進んでいます。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
アイスランドのTrebleがPaladin Capital Group主導で1800万ドルを調達した

Spotifyと業界団体がAI生成楽曲の表示・制限・禁止へ動き出した

テックメディアの新興企業AvailがcreatorAPIを公開

Google DeepmindがGemini 3.8 Liveと3.8 Live Extended ThinkingをGemini APIとGoogle AI Studioで公開

Googleは、言語技術が70億人超、世界人口の86%が話す300超の言語に対応し、Gemini 3.5 Live Translateが70言語のリアルタイム音声を処理すると発表した

Apple出身の研究者Fangchang Ma氏が率いるシアトルのスタートアップNuance Labsが、Lightspeed Venture Partners主導のシリーズAで5000万ドルを調達