
Appleの研究者が統合マルチモーダル生成のためのモデルSTARFlow2を発表した。
何が起きたか
Appleの研究者が、Pretzelアーキテクチャを基盤とする新モデルSTARFlow2を発表した。凍結済みの事前学習済みVLMストリームとTARFlowストリームを組み合わせ、テキストと画像が混在するシーケンスを単一の連続的かつ純粋に因果的な処理で生成・理解できるように設計されている。
なぜ重要か
既存のマルチモーダルモデルは断片的で、視覚的な忠実度を犠牲にしたり、事前学習済みの理解能力を低下させたりすることが多い。STARFlow2は、自己回帰正規化フローを自己回帰Transformerとして扱うことでこの問題を解決しようとしている。これによりLLMと同じ因果マスクとKVキャッシュ機構を共有し、理解能力を維持しながら高忠実度の画像生成を可能にする統一的アプローチを実現する。画像生成モデルを扱う国内の開発現場では、既存手法との性能差が注目される可能性がある。
注目点
研究者らは画像生成とマルチモーダル理解のベンチマークで強い性能を報告しており、自己回帰フローが統合マルチモーダルモデリングの有力な基盤になり得ることを示唆している。アーキテクチャと性能の詳細は研究論文で確認できる。
本研究はAIにおける根本的な構造的問題、つまりテキストと画像の両方を扱うモデルがしばしば異なる技術の寄せ集めである点に取り組んでいる。一部は視覚的詳細を失う離散トークン化に依存し、他は因果的テキストモデルと別個の拡散ベース画像生成器を組み合わせて、非対称で複雑なシステムを作り出している。Appleチームは、自己回帰正規化フローがLLMと因果マスクやKVキャッシュなどの基本的メカニズムを共有しているという観察に基づき、統合アーキテクチャへのより自然な道筋を示唆している。
Pretzelアーキテクチャを基盤に、凍結済みの事前学習済み視覚言語モデルとフローベースのストリームを統合することで、STARFlow2はVLMの深い理解と連続フローの高忠実度生成という両方の利点を得ようとしている。統一FAE潜在空間も重要な構成要素であり、テキストと視覚出力の両方を同じ方法で処理してKVキャッシュに直接入れることを可能にしている。この設計は、視覚情報を別のメカニズムで再エンコードする必要をなくし、モデルをより効率的にすることを意図している可能性が高い。
論文では画像生成とマルチモーダル理解の両方のベンチマークで強い性能が報告されている。自己回帰フローがこの種の統合モデリングの実行可能な基盤として機能するという初期の証拠を提供し、将来の研究をより複雑なハイブリッドシステムから、単一のエレガントな因果メカニズムへと向かわせる可能性がある点で、この結果は重要である。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
メタ・プラットフォームズは、数週間以内にAIエージェント「Hatch」を投入し、10月には「Watermelon」という新AIモデルをリリースする

OpenAIがChatGPTをApple Messagesと統合し、メッセージの検索、会話の要約、Macからの返信作成・送信が可能になった

AppleはMac miniとMac Studioのデスクトップ型コンピューターを刷新した

オープンAIは新たなAIチップ「ハラペーニョ」を発表

火曜日のHot Chips会議で、OpenAIは自社開発チップ「Jalapeño」の初のベンチマーク結果を公表した

IBMは初の推論特化型大規模言語モデル(LLM、テキストを理解・生成するAIシステム)「Granite 4.2」を、3B・8B・30Bの3サイズで公開した
