ニュース

Google、画像や動画にも対応する「EmbeddingGemma 2」を発表

オープンマルチモーダルモデル「EmbeddingGemma 2」

 Googleは10月6日、テキストから動画まで扱える軽量なオープンマルチモーダルモデル「EmbeddingGemma 2」を発表した。現在、Hugging FaceやKaggleからモデルの重みをダウンロード可能。MediaPipeやLiteRTなどを用いたオンデバイスデプロイ、各種開発ツールとの連携に対応している。

 EmbeddingGemma 2はテキストだけでなく、コード、画像、動画、音声を共有の埋め込み空間に統合する。Gemma 4アーキテクチャをベースに構築され、商用利用が可能なApache 2.0ライセンスでリリースされた。パラメータ数は7億4000万個であり、オンデバイスでの推論に最適化されている。

 主な特徴として、10億未満のマルチモーダル埋め込みモデルの中で、MTEB CodeやMAEBなどのベンチマークでサイズ対比で優れたスコアを記録している。また、テキストのみのワークロードには2億7000万個のパラメータ、画像(1億7000万個)と音声(3億個)のエンコーダーを組み合わせるモジュール設計を採用している。

 さらに、マトリョーシカ表現学習(MRL)を用いることで出力ベクトルを768次元から512、256、128次元へ動的に切り詰めることができ、ローカルのベクトルデータベースやメモリ使用量によるストレージ効率を高めている。

 リソース制限のある環境でも効率的に動作し、量子化を使用した「Google Pixel 11 Pro」では、テキストのみのウェイトで約191MB、完全なマルチモーダルモデルで約567MBのRAMを占有する。

 また、コンテキストウィンドウは前モデルの4倍となる8Kトークンに対応し、最大5.5分の音声、29枚の画像、58フレームの動画などをローカルハードウェア上で直接処理できる。