AIToday
大規模言語モデル画像生成Apple Machine Learning掲載日時: 2026年8月26日 1:013分で読める

Apple研究所、STARFlow2発表

LINEで送る
Apple研究所、STARFlow2発表

要点

Appleの研究者が統合マルチモーダル生成のためのモデルSTARFlow2を発表した。

3つのポイント

  1. 何が起きたか

    Appleの研究者が、Pretzelアーキテクチャを基盤とする新モデルSTARFlow2を発表した。凍結済みの事前学習済みVLMストリームとTARFlowストリームを組み合わせ、テキストと画像が混在するシーケンスを単一の連続的かつ純粋に因果的な処理で生成・理解できるように設計されている。

  2. なぜ重要か

    既存のマルチモーダルモデルは断片的で、視覚的な忠実度を犠牲にしたり、事前学習済みの理解能力を低下させたりすることが多い。STARFlow2は、自己回帰正規化フローを自己回帰Transformerとして扱うことでこの問題を解決しようとしている。これによりLLMと同じ因果マスクとKVキャッシュ機構を共有し、理解能力を維持しながら高忠実度の画像生成を可能にする統一的アプローチを実現する。画像生成モデルを扱う国内の開発現場では、既存手法との性能差が注目される可能性がある。

  3. 注目点

    研究者らは画像生成とマルチモーダル理解のベンチマークで強い性能を報告しており、自己回帰フローが統合マルチモーダルモデリングの有力な基盤になり得ることを示唆している。アーキテクチャと性能の詳細は研究論文で確認できる。

この記事についてAIに質問する →

背景と解説

本研究はAIにおける根本的な構造的問題、つまりテキストと画像の両方を扱うモデルがしばしば異なる技術の寄せ集めである点に取り組んでいる。一部は視覚的詳細を失う離散トークン化に依存し、他は因果的テキストモデルと別個の拡散ベース画像生成器を組み合わせて、非対称で複雑なシステムを作り出している。Appleチームは、自己回帰正規化フローがLLMと因果マスクやKVキャッシュなどの基本的メカニズムを共有しているという観察に基づき、統合アーキテクチャへのより自然な道筋を示唆している。

Pretzelアーキテクチャを基盤に、凍結済みの事前学習済み視覚言語モデルとフローベースのストリームを統合することで、STARFlow2はVLMの深い理解と連続フローの高忠実度生成という両方の利点を得ようとしている。統一FAE潜在空間も重要な構成要素であり、テキストと視覚出力の両方を同じ方法で処理してKVキャッシュに直接入れることを可能にしている。この設計は、視覚情報を別のメカニズムで再エンコードする必要をなくし、モデルをより効率的にすることを意図している可能性が高い。

論文では画像生成とマルチモーダル理解の両方のベンチマークで強い性能が報告されている。自己回帰フローがこの種の統合モデリングの実行可能な基盤として機能するという初期の証拠を提供し、将来の研究をより複雑なハイブリッドシステムから、単一のエレガントな因果メカニズムへと向かわせる可能性がある点で、この結果は重要である。

よくある質問

STARFlow2の主要なアーキテクチャ上のアイデアは何か?
STARFlow2はPretzelアーキテクチャを基盤としており、凍結済みの事前学習済み視覚言語モデル(VLM)ストリームとTARFlowストリームを残差スキップ接続で垂直にインターリーブし、すべてを同一の因果マスクの下に置いている。
この新しい設計の利点は何か?
事前学習済みのマルチモーダル理解を維持しつつ、高忠実度の連続画像生成が可能になる。さらに、単一の因果メカニズムの下での構造的统一を実現する。また、テキストと視覚出力が再エンコードなしでKVキャッシュに入る、キャッシュ効率の良いインターリーブ生成もサポートする。
Apple Machine Learning元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へRopedia、ロボット訓練用ウェアラブル「HOMIE Gen2」発表