AIToday

AppleがAI視覚概念推論テストVICIS開発

Apple Machine Learning2日前
AppleがAI視覚概念推論テストVICIS開発

要点

Apple研究者がVICISを発表した。このタスクは、ビジョン言語モデルが画像セットから視覚概念を推論できるかをテストするものである。現在の最先端モデルはこの能力で低い性能を示し、視覚的文脈を無視したり、バイアスのある出力を生成したりする傾向にある。研究者は、視覚概念を抽出・応用するための学習フレームワークとアーキテクチャを提案し、合成データおよび大規模な実世界の画像データセットでの性能と一般化性能が向上したことを実証した。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Apple研究者が、AIのビジョン言語モデルが画像セットから共有される視覚概念を学習し、それを新たなインプットに応用できるかを評価するタスク「Visual Concept Inference from Sets(VICIS)」を発表した。研究者は、現在の最先端モデルがこのタスクで低い性能を示し、視覚的文脈を無視したり、バイアスのある出力を生成したりする傾向にあることを発見した。

  • なぜ重要か

    ビジョン言語モデルは広く使用されているが、画像のみから推論する能力に乏しく、画像を通じて示された概念の変動を生成するようなタスクに必要とされている。本研究は、これらのモデルがテキストではなく視覚的文脈からどのように学習するかについて具体的な課題を明らかにしており、画像理解および生成のためのより高性能なAIシステムの開発に情報をもたらす可能性がある。

  • 注目点

    研究者は、このギャップに対処するための学習フレームワークとアーキテクチャを提案している。彼らのモデルは合成データおよび大規模なImageNet/WordNetデータセットでテストされ、出力の精度と多様性が向上し、スケッチなどの未見の概念およびモダリティへの一般化性能を示した。

詳細

Apple研究者Nick Stracke、Kolja Bauer、Josh Susskind、Miguel Angel Bautista Martin、Björn Ommerは、ビジョン言語モデルの特定の弱点に対処するための新しい評価タスクとソリューションアプローチを発表した。Visual Concept Inference from Sets(VICIS)と呼ばれるこのタスクは、すべて同じ視覚概念を共有する少数の画像セットと別の照会画像が与えられたとき、モデルが例セットで定義された概念を保持しながら照会画像と一貫性のある新しい画像を生成する方法で機能する。例えば、同じオブジェクトを水彩スタイルでレンダリングした複数の画像を示された場合、モデルはそのような水彩処理を新しいオブジェクトに適用できるべきである。

研究者がこのタスクについて現在の最先端のビジョン言語モデルをテストしたところ、これらのモデルが顕著に困難を抱えていることが判明した。モデルは例の画像で提供される視覚的文脈を完全に無視するか、バイアスのかかったデフォルト出力に頼る傾向にある。これは、テキスト指示の追従において高度な能力を持つにもかかわらず、これらのモデルが純粋に視覚的な例から共有される視覚概念を推論し、それを新しいシナリオに応用する能力が限定的であることを明らかにしている。

このギャップを埋めるため、研究者は画像セットから視覚概念を学習し、照会画像から概念固有の埋め込みを抽出するために特別に設計された学習フレームワークと新しいアーキテクチャを開発した。彼らはImageNetおよびWordNetから取得した合成データと大規模な実世界データセットの両方でアプローチを評価した。結果は、彼らのモデルが既存のアプローチと比較して、より正確で多様な出力を生成することを示している。重要なことに、学習中に遭遇しなかった未見の概念、および、スケッチベースのインプットなどの異なるモダリティへの一般化性能も優れており、学習された表現が特定の例を暗記するのではなく、抽象的なレベルで視覚概念をキャプチャしていることを示唆している。

背景と解説

ビジョン言語モデルは複雑なテキスト指示に従うことができるため、現代のAIアプリケーションの中心となっている。しかし、テキストベースの推論におけるこの強さは、純粋に視覚的な例から推論する能力という根本的な弱さを隠している。VICISタスクはこのギャップに直接対処している。言語的な説明に依存するのではなく、モデルは複数の画像例にわたる視覚的パターンを観察し、統一的な概念を抽出してから、それを一貫して新しい画像生成に応用する必要がある。

現在の最先端モデルのVICISでの低い性能は、例からの視覚概念学習がスケーリングや指示追従能力の創発的特性ではないことを明らかにしている。モデルは視覚的な例をテキストのバイアスに優先させる形で軽視するか、提供された文脈との一貫性を欠いた出力を生成している。これは、今日のビジョン言語モデルのアーキテクチャと学習ダイナミクスが、このタイプの視覚推論に適切でないことを示唆しており、研究者は新しい学習フレームワークとアーキテクチャ設計を通じてこの課題に対処している。

よくある質問

VICISとは何で、何をテストするものか?
VICIS(Visual Concept Inference from Sets)は、AIモデルが少数の画像セットから共有概念を推論し、その概念を新たなインプットに応用できるかを評価するタスクである。文脈となる概念を共有する画像セットと照会画像が与えられた場合、モデルは文脈で定義された概念を保持しながら照会画像と一貫性のある新たな画像を生成する必要がある。
現在の最先端モデルはこのタスクでどのような性能を示したか?
最先端のビジョン言語モデルはVICISで低い性能を示し、視覚的文脈を無視したり、バイアスのある生成を行ったりする傾向にある。
研究者はどのようなデータセットを使用して評価を行ったか?
合成データおよび大規模なImageNet/WordNetデータに対して実験が実施され、モデルはスケッチなどの未見の概念およびモダリティへの一般化性能を示した。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます

毎朝1分、AIの要点だけ。

200媒体以上・Email/LINE/Slack 対応

無料で受け取る →