EmbeddingGemma 2(エンベディングジェマ ツー)は、Google DeepMindが2026年10月6日に発表した、初のネイティブ・マルチモーダルなオンデバイス埋め込みモデルです。テキストだけでなくコード・画像・音声・動画をひとつの共有ベクトル空間に写像でき、Apache 2.0ライセンスで公開されています。
室谷代表取締役これは大きいニュースなんですよね。Google DeepMindが「EmbeddingGemma 2」を発表しました。
初代のEmbeddingGemmaはテキスト専用だったんですが、今回はコード・画像・音声・動画までひとつの空間に統合する、ネイティブ・マルチモーダルの埋め込みモデルになっています。
初代のEmbeddingGemmaはテキスト専用だったんですが、今回はコード・画像・音声・動画までひとつの空間に統合する、ネイティブ・マルチモーダルの埋め込みモデルになっています。
テキトー教師DotAI 認定講師しかもオンデバイス向けで、Apache 2.0ライセンスで公開されているのがポイントですよね。単にモデルが大きくなったという話じゃないんですよ。
室谷代表取締役公式スレッドでは「Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings」と紹介されていて、740Mパラメータながら、サイズが2倍以上ある専門特化モデルを上回るベンチマークもあると。
テキトー教師DotAI 認定講師開発者はこれで、音声メモから動画の中の特定の瞬間を探したり、Gemma 4と組み合わせてプライベートなオンデバイスRAGを組んだりできる、というのが公式の説明ですね。
EmbeddingGemma 2とは?Google DeepMindが発表した初のマルチモーダル・オンデバイス埋め込みモデル
EmbeddingGemma 2の特徴
初のマルチモーダル・オンデバイス埋め込みモデル
埋め込みモデルをスマホやPCの上で直接動かす「オンデバイス」向けに作られ、テキスト以外のモダリティも扱える。ここが初代との決定的な違い。
テキスト・画像・音声・動画を768次元の統一ベクトル空間に写像
公式ページによると、Gemma 4のデコーダアーキテクチャをベースとする。
オフラインで動作
コンシューマ向けのGPUやCPU上で動かせる。
発表元はGoogle DeepMind
情報源がXだからといってXが発表したわけではない。あくまでGoogle DeepMindの発表。
室谷代表取締役まず埋め込みモデルって何かというと、テキストや画像などのデータを、意味を反映した数値の並び(ベクトル)に変換するモデルなんですよね。似た意味のデータは似たベクトルになるので、検索・分類・クラスタリングに使えます。
テキトー教師DotAI 認定講師そこがRAGの「検索」段階の品質を左右するわけです。生成AIに渡す文書を探してくる部分ですね。
講座でも受講生さんがよく「RAGの精度が上がらない」と相談されるんですが、原因がこの埋め込みモデルにあるケースは多いんですよ。
講座でも受講生さんがよく「RAGの精度が上がらない」と相談されるんですが、原因がこの埋め込みモデルにあるケースは多いんですよ。
室谷代表取締役今回のEmbeddingGemma 2は、その埋め込みモデルをスマホやPCの上で直接動かす「オンデバイス」向けに作られていて、しかもテキスト以外のモダリティも扱える。ここが初代との決定的な違いなんですよね。
テキトー教師DotAI 認定講師公式ページによると、Gemma 4のデコーダアーキテクチャをベースに、テキスト・画像・音声・動画を768次元の統一ベクトル空間に写像すると。オフラインで、コンシューマ向けのGPUやCPU上で動かせると書かれています。
室谷代表取締役発表元はGoogle DeepMindで、情報源がXだからといってXが発表したわけではないですからね。あくまでGoogle DeepMindの発表です。
テキトー教師DotAI 認定講師そこは整理しておきたいところです。
EmbeddingGemma 2でできること——コード・画像・音声・動画をひとつの空間で検索する
EmbeddingGemma 2でできること
クロスモーダル検索
音声メモから特定の動画クリップを探す、テキストクエリで何時間もの音声録音を検索する。単一のネイティブ・マルチモーダルモデルで処理
コード検索
MTEB Codeスコアが初代68.76から78.68へ9.92ポイント改善。ローカルコードベースのインデックス作成、セマンティックコード検索、コーディングエージェントの検索に適合
オンデバイスRAG
Gemma 4と組み合わせて、プライベートな検索拡張生成を端末上で実行。クラウドにデータを送らずに検索基盤を作れる
セマンティック検索・ゼロショット分類・クラスタリング
事前にラベルを学習させなくても分類できるゼロショット分類を含む公式の用途
室谷代表取締役具体的に何ができるかというと、公式の説明では「音声メモから特定の動画クリップを探す」「テキストクエリで何時間もの音声録音を検索する」といったことが、単一のネイティブ・マルチモーダルモデルで処理できるとされています。
テキトー教師DotAI 認定講師これはクロスモーダル検索と呼ばれるもので、たとえば「先週の会議で誰かが言っていたあの話」を、音声からでも動画からでも探せるということですね。従来はモダリティごとに別々のモデルを用意する必要がありました。
室谷代表取締役あとコード検索も強化されていて、公式ページではMTEB Codeのスコアが初代の68.76から78.68へ、9.92ポイント改善したと書かれています。ローカルのコードベースのインデックス作成やセマンティックコード検索、コーディングエージェントの検索に向いていると。
テキトー教師DotAI 認定講師ここは開発者にとってはかなり実用的な進化ですよね。自然言語のクエリからコードブロックを探す、というユースケースが現実的になります。
室谷代表取締役公式ページには、マルチモーダルRAG、セマンティック検索、ゼロショット分類といった用途が挙げられています。ゼロショット分類というのは、事前にラベルを学習させなくても分類できるという意味ですね。
テキトー教師DotAI 認定講師整理するとこうです。
- クロスモーダル検索:音声メモから動画クリップを探す、テキストクエリで音声録音を検索する
- コード検索:自然言語クエリからコードブロックを取得、ローカルコードベースのインデックス作成
- オンデバイスRAG:Gemma 4と組み合わせて、プライベートな検索拡張生成を端末上で実行
- セマンティック検索・ゼロショット分類・クラスタリング
室谷代表取締役こうして並べると、クラウドにデータを送らずに検索基盤が作れるというのが一番の価値なんですよね。プライバシーが守られるし、通信がなくても動く。
テキトー教師DotAI 認定講師MYUUUでもオンデバイス系の検証はされているんですか。
室谷代表取締役まだこのモデル自体は触れていないんですが、オンデバイスでRAGを組む流れは前から注目していて。データを外に出せない業種の案件では、こういう選択肢が出てくるのは大きいんですよね。
EmbeddingGemma 2の使い方・始め方——Hugging FaceとKaggleで重みを入手し、Gemma 4と組み合わせる
EmbeddingGemma 2の入手方法と連携ツール
モデル重みの入手先
Hugging FaceとKaggleで公開。Gemini Enterprise Agent Platform Model Gardenでも近日提供予定
オンデバイス向けモデル
Hugging Face上のLiteRT Communityで入手可能
開発ツール連携
transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudio
オンデバイス展開
Google AI Edge MediaPipe または LiteRT
ブラウザ実行
transformers.js または WebGPU
ファインチューニング
Unslothのガイダンスに従う。公式の開発者ガイドとドキュメントも用意
Gemma 4との組み合わせ
同じトークナイザーと音声エンコーダを共有。統合パイプラインで合計メモリフットプリントを抑えられる
推奨ユースケース
Gemma 4 E2Bと組み合わせ、モバイルファーストのRAGパイプラインやチャットボットを構築。クイックスタートのRAGノートブックも案内
室谷代表取締役入手方法は公式ページに書かれていて、Hugging FaceとKaggleでモデルの重みが公開されています。Gemini Enterprise Agent Platform Model Gardenでの提供も近日予定とされています。
テキトー教師DotAI 認定講師オンデバイス向けに最適化されたモデルは、Hugging Face上のLiteRT Communityで入手できると案内されていますね。
室谷代表取締役開発ツールとの連携も幅広くて、transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudioといったツールで動かせると。オンデバイス展開ならGoogle AI Edge MediaPipeかLiteRT、ブラウザならtransformers.jsやWebGPUが挙げられています。
テキトー教師DotAI 認定講師ファインチューニングはUnslothのガイダンスに従う形ですね。公式の開発者ガイドとドキュメントも用意されています。
室谷代表取締役あとGemma 4との組み合わせが面白くて、EmbeddingGemma 2はGemma 4と同じトークナイザーと音声エンコーダを共有しているんですよ。だから両方を統合パイプラインで動かすと、合計のメモリフットプリントを抑えられる。
テキトー教師DotAI 認定講師公式ページでは「Gemma 4 E2Bと組み合わせて、モバイルファーストのRAGパイプラインやチャットボットを構築する」ことが推奨されていて、クイックスタートのRAGノートブックも案内されています。
室谷代表取締役Gemma 4自体はテキスト・音声・画像入力と最大256Kのコンテキストに対応しているので、そこにEmbeddingGemma 2の検索を組み合わせる形ですね。
テキトー教師DotAI 認定講師EmbeddingGemma 2のライセンスと提供範囲——Apache 2.0で公開、オンデバイスRAGにどう効くか
室谷代表取締役ライセンスはApache 2.0です。これは商用利用が許容される寛容なライセンスで、ファインチューニングして自分のプロジェクトやアプリにデプロイできると公式ページに明記されています。
テキトー教師DotAI 認定講師ここは実務で使う人にとっては重要なポイントですよね。ライセンス名は正確に押さえておきたいところです。
室谷代表取締役オンデバイスRAGにどう効くかというと、埋め込みを端末上で生成できるので、データが外部に送られない。プライバシーが守られ、パイプラインのレイテンシも下がり、完全にオフラインで動くクロスモーダル検索が作れるとされています。
テキトー教師DotAI 認定講師RAGの検索段階の品質が回答全体を左右するので、そこで高品質な埋め込みが端末上で得られるのは大きいですね。
室谷代表取締役ストレージ効率も見どころで、MRL(Matryoshka表現学習)によって出力ベクトルを768次元から512、256、128次元へ動的に切り詰められる。これでローカルのベクトルデータベースのストレージを最大6倍削減できるとされています。
テキトー教師DotAI 認定講師端末のストレージは限られるので、次元を柔軟に落とせるのは効きますよね。
室谷代表取締役メモリも、量子化を使うとGoogle Pixel 11 Pro上でテキスト専用の重みが約191MB、フルマルチモーダルモデルで約567MBのアクティブRAMで動くと公式ページに書かれています。
テキトー教師DotAI 認定講師モジュール設計というのも面白くて、テキスト専用なら270Mパラメータから始められて、ビジョン用の170M、音声用の300Mのエンコーダをオプションで足せる構成になっています。
室谷代表取締役必要な機能だけ載せられるわけですね。全部入りにしなくていいという設計は、端末向けとしては理にかなっています。
初代EmbeddingGemmaからの進化——テキスト専用からマルチモーダルへ、740Mパラメータの実力
室谷代表取締役初代のEmbeddingGemmaは2025年9月に発表された、308Mパラメータのテキスト専用モデルでした。Gemma 3ベースで、100以上の言語に対応し、量子化で200MB未満のRAMで動く。
2Kトークンのコンテキストで、MRLにより768から128次元まで削減できる。
2Kトークンのコンテキストで、MRLにより768から128次元まで削減できる。
テキトー教師DotAI 認定講師これが2,000万回以上ダウンロードされて、オンデバイス検索やプライバシー重視のRAGに使われてきたわけですね。ただ扱えるのはテキストだけだった。
室谷代表取締役そこが今回の進化の核心で、EmbeddingGemma 2はテキスト専用からネイティブ・マルチモーダルへと拡張されたんですよね。パラメータ数は740Mになっています。
テキトー教師DotAI 認定講師公式ページの比較では、ベースのテキストとコードのモデルサイズは300Mから270Mに縮小されている一方で、ビジョンと音声のエンコーダが加わって全体で740Mになっている、という構成ですね。
室谷代表取締役コンテキストも2Kから8Kトークンへ4倍に拡大していて、これは音声で最大5.5分、画像29枚、動画58フレーム、あるいはそれらの組み合わせを処理できる量だとされています。
テキトー教師DotAI 認定講師ここは数字として押さえておきたいですね。整理するとこうです。
- パラメータ数:740M(テキスト・コード270M+ビジョン170M+音声300Mのモジュラー構成)
- コンテキスト:8Kトークン(初代の4倍)
- 対応モダリティ:テキスト・コード・画像・音声・動画
- 出力次元:768から128まで動的に削減可能(MRL)
- メモリ:量子化でテキスト専用約191MB、フルマルチモーダル約567MB(Google Pixel 11 Pro)
- ライセンス:Apache 2.0
室谷代表取締役ベンチマークも見ておくと、MTEB Codeが68.76から78.68へ9.92ポイント改善。MTEB CodeとMAEB(Massive Audio Embedding Benchmark)で、1B未満のマルチモーダル埋め込みモデルの中でトップクラスのスコアを達成し、テキスト・ビジョン・音声のタスクでより大きなモデルに匹敵または上回る、と公式ページに書かれています。
テキトー教師DotAI 認定講師サイズが2倍以上ある専門特化モデルを上回る場合もある、というのが公式スレッドの表現ですね。
室谷代表取締役ただ、具体的にどのモデルと比べてどうか、という個別の比較は今回のソースには書かれていないので、そこは現時点では明らかにされていないという扱いでいいと思います。
テキトー教師DotAI 認定講師そうですね。ベンチマークの詳細は公式のモデルカードに載っているので、そちらを確認するのが確実です。
室谷代表取締役あと初代のモデルカードには、MTEB Multilingual v2で768次元が61.15、MTEB English v2で69.67といった数値が載っています。これは初代の数字なので、2の数字と混同しないようにしたいところです。
テキトー教師DotAI 認定講師世代が違う数字を並べるときは注意が必要ですね。
EmbeddingGemma 2が注目される背景と狙い——オンデバイスでのクロスモーダル検索というニーズ
室谷代表取締役なぜこれが求められていたかというと、初代はテキスト専用で、動画・音声・画像を横断した検索ができなかったんですよね。でも音声メモから動画クリップを探す、テキストで長時間の音声を検索する、といったニーズは現実にあった。
テキトー教師DotAI 認定講師それをクラウドに送らず、オンデバイスで完結させたいという要求ですね。プライバシーの観点でも、レイテンシの観点でも。
室谷代表取締役業界の流れとしても、MediaTekのNPUとLiteRTの連携で、Gemma 3 270MやGemma 3n E2B、EmbeddingGemma 300MといったモデルがNPU上でCPU比最大12倍、GPU比10倍で高速化される、という話があります。
テキトー教師DotAI 認定講師ハードウェア側の受け皿が整ってきているわけですね。NPUが普及してきたからこそ、こういうモデルが実用的になる。
室谷代表取締役あとGemma 4がテキスト・音声・画像入力と最大256Kのコンテキストに対応していて、EmbeddingGemma 2はGemma 4と同じトークナイザーと音声エンコーダを共有している。だから統合パイプラインを低メモリで実行できると。
テキトー教師DotAI 認定講師モデル単体ではなく、Gemma 4と組ませることで真価が出る設計なんですね。
室谷代表取締役Google DeepMindとしては、Androidのような自社プラットフォームの体験を支える技術を、開発者が使い慣れたツールで使えるようにする、という狙いがあると読めます。
テキトー教師DotAI 認定講師このあたりのGoogle DeepMindの動きは、Google DeepMind、4秒画像生成と会話型動画編集の新モデルを一挙リリースやGoogle DeepMind「Gemini Robotics 2」全身制御AI発表と合わせて見ると、マルチモーダルへの投資が一貫しているのが分かりますね。
室谷代表取締役モデルの入手先であるHugging Faceについて、基本的なところはHugging Faceとは?できること・料金・商用利用とNVIDIA買収の現在で解説しているので、初めての人はそちらから入るといいと思います。
EmbeddingGemma 2に関するよくある質問
室谷代表取締役ここからは、よく聞かれそうな点を整理していきますね。
テキトー教師DotAI 認定講師まず正式リリースされているのかどうか。これは2026年10月6日にGoogle DeepMindが発表し、Hugging FaceとKaggleで重みが公開されています。
Gemini Enterprise Agent Platform Model Gardenでの提供は近日予定とされています。
Gemini Enterprise Agent Platform Model Gardenでの提供は近日予定とされています。
室谷代表取締役ライセンスはApache 2.0で、商用利用も可能な寛容なライセンスです。ファインチューニングして自社のプロジェクトにデプロイできると公式ページに書かれています。
テキトー教師DotAI 認定講師対応モダリティはテキスト・コード・画像・音声・動画の5種類。テキストとコードは100以上の言語に対応し、8Kトークンのコンテキストを持ちます。
室谷代表取締役パラメータ数は740Mで、テキスト・コード270M、ビジョン170M、音声300Mというモジュラー構成です。テキスト専用なら270Mから使えます。
テキトー教師DotAI 認定講師初代との違いは、テキスト専用からネイティブ・マルチモーダルへの拡張、コンテキストの2Kから8Kへの拡大、コード性能の9.92ポイント改善、そしてベースモデルサイズの300Mから270Mへの縮小ですね。
室谷代表取締役メモリ要件は、量子化でGoogle Pixel 11 Pro上、テキスト専用の重みが約191MB、フルマルチモーダルで約567MBのアクティブRAMです。
テキトー教師DotAI 認定講師使い方は、Hugging FaceかKaggleから重みを入手して、transformersやsentence-transformers、Ollama、LMStudioなどのツールで動かす形です。オンデバイスならLiteRTやGoogle AI Edge MediaPipe、ブラウザならtransformers.jsやWebGPUが案内されています。
室谷代表取締役Gemma 4との連携については、同じトークナイザーと音声エンコーダを共有しているので、統合パイプラインを低メモリで実行できるとされています。公式ページではGemma 4 E2Bと組み合わせたモバイルファーストのRAGが推奨されています。
テキトー教師DotAI 認定講師Gemini Embedding 2との関係については、EmbeddingGemma 2はGemini Embeddingモデルと同じ技術から作られていると公式ページに書かれていますが、両者の具体的な違いや使い分けの詳細は今回のソースでは明らかにされていません。
室谷代表取締役そこは憶測で埋めずに、公式の続報を待つところですね。
テキトー教師DotAI 認定講師対応言語は100以上、コンテキストは8Kトークンで、音声なら最大5.5分、画像29枚、動画58フレームを処理できるとされています。
室谷代表取締役というわけで、オンデバイスでマルチモーダルな検索やRAGを組みたい人にとっては、かなり現実的な選択肢が出てきたという話なんですよね。Apache 2.0で商用も可能なので、プロダクトに組み込むハードルは低いと思います。
テキトー教師DotAI 認定講師まずはHugging Faceで重みを確認して、クイックスタートのRAGノートブックを動かしてみるのが最初の一歩ですね。
