ニュース
Google、画像や動画にも対応する「EmbeddingGemma 2」を発表
2026年10月9日 12:53
Googleは10月6日、テキストから動画まで扱える軽量なオープンマルチモーダルモデル「EmbeddingGemma 2」を発表した。現在、Hugging FaceやKaggleからモデルの重みをダウンロード可能。MediaPipeやLiteRTなどを用いたオンデバイスデプロイ、各種開発ツールとの連携に対応している。
EmbeddingGemma 2はテキストだけでなく、コード、画像、動画、音声を共有の埋め込み空間に統合する。Gemma 4アーキテクチャをベースに構築され、商用利用が可能なApache 2.0ライセンスでリリースされた。パラメータ数は7億4000万個であり、オンデバイスでの推論に最適化されている。
主な特徴として、10億未満のマルチモーダル埋め込みモデルの中で、MTEB CodeやMAEBなどのベンチマークでサイズ対比で優れたスコアを記録している。また、テキストのみのワークロードには2億7000万個のパラメータ、画像(1億7000万個)と音声(3億個)のエンコーダーを組み合わせるモジュール設計を採用している。
さらに、マトリョーシカ表現学習(MRL)を用いることで出力ベクトルを768次元から512、256、128次元へ動的に切り詰めることができ、ローカルのベクトルデータベースやメモリ使用量によるストレージ効率を高めている。
リソース制限のある環境でも効率的に動作し、量子化を使用した「Google Pixel 11 Pro」では、テキストのみのウェイトで約191MB、完全なマルチモーダルモデルで約567MBのRAMを占有する。
また、コンテキストウィンドウは前モデルの4倍となる8Kトークンに対応し、最大5.5分の音声、29枚の画像、58フレームの動画などをローカルハードウェア上で直接処理できる。








![ALL for AI――プロダクトマネージャーの新しい武器[生成AI]の使い方 製品画像:5位](https://m.media-amazon.com/images/I/51lCl3iybHL._SL160_.jpg)
![[みのるん式]ビジネスパーソンのためのClaude Code仕事術 製品画像:6位](https://m.media-amazon.com/images/I/51clwCUvB0L._SL160_.jpg)





![Claude Code実践入門 [生成AI深掘りガイド] 製品画像:3位](https://m.media-amazon.com/images/I/41onRRY91KL._SL160_.jpg)


























