
何が起きたか
Black Forest Labsが基盤モデルFLUX 3を使うFLUX 3 Imageを公開。最大4K生成、被写体のバウンディングボックス配置、ピクセル単位の部分編集、最大10枚の参照画像に対応。
なぜ重要か
バウンディングボックス制御で各被写体の位置を正確に指定できる。試行錯誤のプロンプトに頼るデザイナーやマーケターに響きそうだ。
注目点
オープンモデル版は数週間以内に登場。有料サービスと同じ機能を持つかが試金石だ。例で示された日本語テキスト生成が同版に載るかも注目。
誰に効くか画像全体の再生成ではなく精密なレイアウト制御や部分編集を求めるデザイナー、マーケティングチーム、独立系イラストレーターが最も恩恵を受ける。オープンウェイト版を待つ開発者は数週間以内にオンプレミス利用を得る可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
FLUX 3 Imageは画像と動画の両方を扱うBlack Forest Labsの基盤モデルFLUX 3上に構築されており、ゼロからの新規開発ではなく既存の基盤を拡張したものだ。同社は制御の中核にバウンディングボックスという限定領域を据えた。公開された一例では、後ろ姿の人物を中央に、モダンな建物を奥左に、古典的な建物を奥右に配置し、出力はその指定を高品質で反映したという。
画像内の日本語テキストにも対応し、縦書きも扱える。4K出力にズームして細部を確認することも可能だ。参照画像は最大10枚まで入力でき、含まれる物体の位置も指定できる。編集時は触れていないピクセルをピクセル単位で保持する。
焦点は約束されたオープンモデル版の公開にある。無償版がバウンディングボックス制御と参照画像の上限を維持すれば、有料APIを使えない小規模スタジオや開発者も同等の能力を得られるかもしれない。機能が削られていれば、精密なレイアウト作業では有料版が現実的な選択であり続けるだろう。いずれにせよ、画質だけでなく配置の制御こそがBlack Forest Labsが賭ける差別化要因に見える。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
NVIDIAがDIN Deployを公開

AWSが選択を行うオープンソース判断モデルStrands Decider 2Bを公開
Runwayはロボット制御向けの初のオープンウェイト世界行動モデル「Praxis-1」を発表

IdeogramがIdeogram 4.5を発表

Magnitude開発チームが、PC上でモデルカーネルをコンパイル・調整するオープンソース推論エンジンを公開

AIのAtaraxosが、Strategoで最も実績のあるNiemeijerを3週間で実効勝率85%で破った
