AIToday
動画生成音声・スピーチTHE DECODER掲載日時: 2026年7月24日 4:02

Black Forest Labs、音声付き動画生成Flux 3公開

LINEで送る
Black Forest Labs、音声付き動画生成Flux 3公開

3つのポイント

  1. 何が起きたか

    ドイツのAI企業Black Forest Labs(BFL)が、画像・動画・音声を統合学習するマルチモーダル基盤モデル「Flux 3」を発表しました。動画に直接音声を付加する機能をAI動画生成では初めて実装し、最長20秒のクリップに対応しています。

  2. なぜ重要か

    BFLの初期評価では、Flux 3は10秒・720pの動画でLuma Ray 3.2に対して93%の比較で、Runway Gen-4.5に対して77%の比較で優位性を示しました。単一のモダリティでは現実を完全に捉えられないという考えに基づき、複数のモダリティを組み合わせることで、より正確な「世界モデル」の構築へ向かう動きの一環とみられます。

  3. 注目点

    Flux 3 Videoは既に利用可能で、Flux 3 Imageは数週間以内のアーリーアクセス提供を予定しており、オープンウェイト版「Flux 3 Dev」の段階的公開も計画されています。また、Mimic Roboticsと協力開発した動画・行動予測モデル「Flux-mimic」はAudiの生産タスクで現在テスト中です。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Black Forest Labsが発表したFlux 3は、画像・動画・音声を単一モデルで同時学習する「Self-Flow」アプローチに基づいています。BFLは、単一のモダリティでは現実を完全に捉えられないと指摘しており、画像は空間構造を、動画は時間的な変化を、音声は機械的事象と音の関連性を明らかにすることで、各モダリティが互いのギャップを埋める効果があると説明しています。

Flux 3はこうした統合学習による高い動画生成品質を示す一方、BFL自身が「結果は予備的」と述べており、独立した第三者による検証はまだ利用可能ではありません。既に公開されているSeedance 2.0やGemini Omni Flashといった既成の有力モデルとの競争関係が焦点となります。さらに、BFLは行動予測コンポーネントを備えており、Mimic Roboticsとの協力によるAudiでの生産タスク向けテストなど、ロボティクス応用への展開も進んでいます。

よくある質問
Flux 3で生成できる動画の長さは?
最長20秒のクリップに対応しています。初期評価は10秒クリップ・720p解像度で実施されました。
Flux 3の他の動画生成AIとの性能差は?
BFLの初期評価では、Luma Ray 3.2との比較で93%、Runway Gen-4.5との比較で77%、Grok Imagine Videoとの比較で69%で優位性を示しました。Seedance 2.0とGemini Omni Flashとは52%で同等とされています。
Flux 3の利用開始時期は?
Flux 3 Videoは既に利用可能です。Flux 3 Imageは数週間以内のアーリーアクセス提供が予定されています。
LINEで送る

「動画生成」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Avail、AI広告作成API公開Semafor Tech · 1日前
  • NBCがAI女優Tilly Norwoodを放送Hacker News · 2日前
  • AppLovinの成長を阻む30~60秒動画Top Companies AI · 3日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へ手動設定の重みが学習モデルの拡張性に匹敵、効率は劣る