
何が起きたか
Google DeepMindがEmbeddingGemma 2を公開。商用利用可能なApache 2.0ライセンスのオープンなマルチモーダル埋め込みモデルで、7億4,000万パラメータを持つ。
なぜ重要か
テキスト専用の前版は2,000万ダウンロードを突破済み。画像・音声・動画も扱えるようになり、これまでテキストのみだった検索ツールにも広がる可能性がある。
注目点
Google Pixel 11 Proでテキスト専用は約191MB、マルチモーダルは約567MB。MTEB CodeとMAEBの第三者検証に注目だ。
誰に効くか恩恵が最も大きいのは、端末上やオフラインで動くアプリを手がける開発者だ。モデルはHugging FaceとKaggleからダウンロードでき、LiteRTやGoogle AI Edge MediaPipeなどのツールで導入できる。機密性の高い音声・画像・動画データを扱うチームにとって、ローカルで動く埋め込みモデルは魅力的に映るかもしれないが、メモリ値はあくまでGoogle自身の公表値である。
こういう要約が、毎朝あなたのメールに届きます。
EmbeddingGemmaは昨年、高品質なテキスト埋め込みの軽量な選択肢として登場し、アプリが消費者向けハードウェア上で直接情報を整理・検索・接続できるようにすることを狙っていた。Google DeepMindによれば、開発者コミュニティの反響は予想を大きく超え、2,000万ダウンロードを突破し、端末上の検索ツールやプライバシー重視の検索パイプラインで使われている。EmbeddingGemma 2はその後継で、Gemma 4アーキテクチャを基に、テキストを超えてコード・画像・動画・音声を共有の埋め込み空間に統合する。
設計上の選択は「ローカルで動く小ささを保つ」という一方向を指している。7億4,000万パラメータを持ちながら、テキスト専用のワークロードでは最小2億7,000万パラメータで済み、任意で視覚(1億7,000万)と音声(3億)のエンコーダを追加できる。Matryoshka表現学習により、開発者は出力ベクトルを768次元から512、256、128次元へ切り詰められ、Googleによればローカルのベクトルデータベースの保存量を最大6倍削減できる。8KトークンのコンテキストウィンドウはEmbeddingGemma 1の4倍で、最大5.5分の音声、29枚の画像、58の動画フレーム、またはそれらの混在した組み合わせを処理できる。
品質面でGoogleは、EmbeddingGemma 2がMTEB CodeやMAEBなどのベンチマークで10億パラメータ未満のマルチモーダル埋め込みモデルの中で首位に立ち、テキスト・視覚・音声の各分野で多くの大規模モデルに匹敵するか上回ると述べている。結果を左右するのは、この「パラメータあたりの品質」という主張が開発者自身のハードウェアでの検証に耐えるかどうか、そしてメモリ値がGoogle自身のPixel 11 Pro以外でも快適な性能につながるかどうかだ。GoogleはGemini Enterprise Agent Platform Model Gardenでの提供が近日中に始まるとしている。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
富士通が店舗運営と経営判断を支援する4種類のAIエージェントを発表し、同日から試験提供を開始

ACSHUがソフトバンクの「AGENTIC STAR インテグレーションパートナー アライアンス」に参画し、企業導入を計画段階から運用まで支援する

富士通が、店舗運営と経営判断の高度化を狙う小売業向けAIエージェントの試用環境の提供を開始した

Lowe's CEOのMarvin Ellison氏によると、Mylowは2500万件超の質問を受け、コンバージョン率3倍

BlackRockの「The Machine-Native Economy」は、AIエージェントが1セント未満の取引向けに24時間稼働の決済システムを必要とすると指摘
