AIToday
大規模言語モデルオープンソースAIZenn AI/ML掲載日時: 2026年10月7日 22:00

embeddinggemma-2検証、画像→文章検索は精度に課題

LINEで送る
embeddinggemma-2検証、画像→文章検索は精度に課題

3つのポイント

  1. 何が起きたか

    Google DeepMindのgoogle/embeddinggemma-2をGoogle Colab無料版で動かし、日本語「猫の写真」で猫画像が2位(0.7149)、「宇宙へ飛んでいくロケット」でrocket画像が2位(0.7115)に入った。

  2. なぜ重要か

    テキスト・画像・音声を同一空間で扱えることは確認できたが、画像から文章を探す方向や音声検索では期待した順位が得られず、用途によって精度差が大きいとみられる。

  3. 注目点

    今回の小規模な実験結果であり、検索精度はQueryのモダリティや長さ、データ内容によって変わる点が焦点。MRLにより256次元でも768次元と同じ順位が得られた点は今後の検証対象。

誰に効くか自社RAG基盤や社内文書・音声資産の横断検索を検討する情報システム部門は、マルチモーダルEmbeddingの導入時に方向別の検索精度を事前検証する必要があるとみられる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

EmbeddingGemma 2は、Google DeepMindが公開したオープンなマルチモーダルEmbeddingモデルで、Text・Image・Video・Audioを比較可能な同一の768次元空間へ写す点が特徴である。従来は文章・画像・音声それぞれに別モデル・別空間を使うことが多かったが、本モデルではcosine similarityだけで異なるメディア同士を比較できる。ライセンスはApache 2.0で、Hugging Faceで公開されている。

今回の検証では、日本語の「猫の写真」というQueryで猫について説明した文章と実際の猫画像が1位・2位になり、「コーヒーを飲みたい」でもコーヒーについての文章とcoffee画像が上位に入った。ロケットの例でも宇宙開発の文章とrocket画像が上位を占め、テキストから画像への検索は分かりやすく動作した。

一方、猫画像をQueryにした場合はQueryと同じ画像を除くとcoffee画像、camera画像、猫についての文章の順となり、正解文章は4位にとどまった。「人が話している音声」というQueryでも、音声データそのものは上位7件に入らなかった。Queryのモダリティ、検索対象のモダリティ、Queryの長さ、画像の内容、文章の抽象度、データセットによって難易度が変わるため、共通空間だから何でも高精度に検索できると理解するのは危険だとみられる。

実用面では、EmbeddingGemma 2は文章を生成せず、検索・類似度計算・クラスタリング・分類・RAG・推薦などを可能にする。研究室のPDF、講義スライド、写真、実験動画、講演音声を横断検索するCross-media RAGへの応用が考えられるが、その成否は用途ごとの検索精度の検証にかかっている。

よくある質問
EmbeddingGemma 2は何ができますか?
文章・画像・音声・動画を同じ768次元のベクトル空間へ変換し、cosine similarityで異なるメディア同士を比較できる。文章生成は行わない。
無料のGoogle Colabでも動きますか?
無料版で問題なく動作し、実行日は2026年10月7日。総パラメータ数約740Mのため、数十B・数百BクラスのLLMより扱いやすい。
検索精度はどの方向でも同じですか?
同一空間に入ることと全方向で高精度に検索できることは別。日本語テキストから画像検索は明確に動作したが、画像から文章検索では猫画像の正解文章が4位(0.6542)だった。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へChatGPTがNYer漫画家15人超の署名を偽造