
何が起きたか
Google DeepMindのgoogle/embeddinggemma-2をGoogle Colab無料版で動かし、日本語「猫の写真」で猫画像が2位(0.7149)、「宇宙へ飛んでいくロケット」でrocket画像が2位(0.7115)に入った。
なぜ重要か
テキスト・画像・音声を同一空間で扱えることは確認できたが、画像から文章を探す方向や音声検索では期待した順位が得られず、用途によって精度差が大きいとみられる。
注目点
今回の小規模な実験結果であり、検索精度はQueryのモダリティや長さ、データ内容によって変わる点が焦点。MRLにより256次元でも768次元と同じ順位が得られた点は今後の検証対象。
誰に効くか自社RAG基盤や社内文書・音声資産の横断検索を検討する情報システム部門は、マルチモーダルEmbeddingの導入時に方向別の検索精度を事前検証する必要があるとみられる。
こういう要約が、毎朝あなたのメールに届きます。
EmbeddingGemma 2は、Google DeepMindが公開したオープンなマルチモーダルEmbeddingモデルで、Text・Image・Video・Audioを比較可能な同一の768次元空間へ写す点が特徴である。従来は文章・画像・音声それぞれに別モデル・別空間を使うことが多かったが、本モデルではcosine similarityだけで異なるメディア同士を比較できる。ライセンスはApache 2.0で、Hugging Faceで公開されている。
今回の検証では、日本語の「猫の写真」というQueryで猫について説明した文章と実際の猫画像が1位・2位になり、「コーヒーを飲みたい」でもコーヒーについての文章とcoffee画像が上位に入った。ロケットの例でも宇宙開発の文章とrocket画像が上位を占め、テキストから画像への検索は分かりやすく動作した。
一方、猫画像をQueryにした場合はQueryと同じ画像を除くとcoffee画像、camera画像、猫についての文章の順となり、正解文章は4位にとどまった。「人が話している音声」というQueryでも、音声データそのものは上位7件に入らなかった。Queryのモダリティ、検索対象のモダリティ、Queryの長さ、画像の内容、文章の抽象度、データセットによって難易度が変わるため、共通空間だから何でも高精度に検索できると理解するのは危険だとみられる。
実用面では、EmbeddingGemma 2は文章を生成せず、検索・類似度計算・クラスタリング・分類・RAG・推薦などを可能にする。研究室のPDF、講義スライド、写真、実験動画、講演音声を横断検索するCross-media RAGへの応用が考えられるが、その成否は用途ごとの検索精度の検証にかかっている。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Zennの筆者がClaude Docsの「タスク管理帳」1枚を紹介

投稿者がdots・Claude Code・Codexをつなぐ仕組みを試験運用し、2026-10-06から1日ほどで21件を処理した

9月25日17時44分、Claude Codeに起動させたCeleryのワーカーとbeatが会話を閉じると同時に終了し、翌朝に定期実行が止まっていたことが判明した

ユーザーはNew Yorker風の漫画をChatGPTに頼んだだけだが、Brendan Loperの「BLoper」署名が自動で追加された

ガートナーは、ベンダーのFDEが開発したAIエージェントの70%が2028年までに企業に使われず放棄されると予測

インプレスが芦沢央氏の著書を10月7日に1,980円で発売
