本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]
Google DeepMindは、テキスト・コード・画像・動画・音声を共通の数値表現に変換するAIモデル「EmbeddingGemma 2」を公開した。2026年10月6日付の公式発表によると、7億4000万パラメータのモデルで、ライセンスはApache 2.0。スマートフォンなどの端末内で、異なる種類のデータを横断検索する用途を想定している。
異なるデータを共通の検索空間へ
EmbeddingGemma 2はGemma 4を基盤とし、従来のテキスト中心の埋め込み機能を画像・動画・音声に拡張したモデルだ。Googleは、音声メモを手がかりに動画の該当箇所を探すような検索を用途として挙げている。Google AI Edge Galleryでは、動画の場面を検索できる「Video Moments Finder」などのデモも提供している。
モデルカードによると、テキスト、画像、動画、音声の4種類のデータを共通の768次元ベクトルへ変換する。コードはテキストに含まれ、コンテキスト長は8192トークン。7億4000万パラメータの内訳は、テキスト用2億7000万、画像用1億7000万、音声用3億となる。
画像・音声のエンコーダーは必要に応じて読み込める。テキストのみなら2億7000万パラメータの構成で使用でき、用途に合わせてモデルの規模を調整できる。
Googleによると、量子化した完全版をPixel 11 Proで動作させた場合、アクティブRAMの使用量は約567MB。テキスト用の重みでは約191MBとしている。いずれも特定の端末と量子化条件で示された数値だ。
出力ベクトルは768次元から512、256、128次元へ短縮でき、検索用データの保存容量を削減できる。ただし、128次元ではマルチモーダル品質が大きく低下するという。ベクトルの短縮による保存容量の削減と、モデルの重みを量子化してメモリー使用量を抑える仕組みは異なる。
公式モデルカードのベンチマーク結果はフル精度のモデルを評価したもので、量子化した端末上での性能を直接示すものではない。モデルの重みはHugging FaceとKaggleで公開されている。
