EmbeddingGemma 2是一款由谷歌DeepMind于2026年10月推出的开源多模态嵌入模型,主要用于把文本、代码、图像、视频与音频映射到统一的向量空间,支持 768 维输出与 8,192 token 上下文,适用于端侧语义检索、检索增强生成与内容聚类等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 开源多模态嵌入模型 |
| 出品方 | 谷歌 DeepMind |
| 发布时间 | 2026年10月6日 |
| 总参数量 | 740M(文本270M+视觉170M+音频300M) |
| 输出维度 | 768(可截断至 128/256/512) |
| 上下文窗口 | 8,192 token |
| 支持模态 | 文本、代码、图像、视频、音频 |
| 开源协议 | Apache-2.0 |
| 部署方式 | 端侧部署(支持选择性加载编码器) |

EmbeddingGemma 2 的核心能力
EmbeddingGemma 2 由谷歌DeepMind在 Gemma 4 的架构基础上构建,把文本(含代码)、图像、视频与音频编码到同一个 768 维向量空间,用于语义检索、分类、聚类与相似度计算。权重以 Apache-2.0 协议开放,可在手机与笔记本等消费级硬件上运行。
统一的多模态向量空间
模型把四类模态映射到同一向量空间,文本、图像、视频与音频可以出现在同一条输入中。文本部分用占位标记各类媒体的位置,整条输入共享 8,192 token 上下文;一次调用返回一个嵌入向量,可直接与任何其他 EmbeddingGemma 2 向量比较。
面向端侧的轻量设计
模型总参数 740M,由 270M 的文本骨干、170M 的视觉编码器与 300M 的音频编码器组成。两个模态编码器可按需关闭:仅加载文本部分时为 270M,文本加图像为 440M,文本加音频为 570M,完整多模态为 740M。官方给出的端侧数据显示,量化后在 Pixel 11 Pro 上运行纯文本权重约需 191MB 内存,完整多模态模型约需 567MB。
Matryoshka 截断与存储优化
输出向量默认 768 维,采用 Matryoshka 表示学习训练,可按需截断到 512、256 或 128 维。官方实测在 256 维时质量接近无损,128 维更适合纯文本任务,向量存储与内存占用最高可降至六分之一。截断后的向量需重新做 L2 归一化,查询端与文档端也必须使用相同维度,否则相似度排序会失真。
多语言与代码能力
模型覆盖 100 种以上语言,预训练语料包含 140 种以上语言的内容。与前代相比,代码任务的提升最明显:MTEB code 基准由 68.76 提升到 78.68,提高 9.92 分;文本侧 MTEB 多语言 v2 得分为 61.36,与前代的 61.15 基本持平。官方把这一变化指向本地代码库索引、语义代码搜索与编程代理检索。
检索与多模态基准表现
在 768 维输出下,模型的 MMEB v2 综合得分为 59.01,图像检索 MIEB lite 为 64.64,视觉文档 MMEB v2 为 67.84,视频 MMEB v2 为 50.67,音频检索 MSEB 为 69.54,音频理解 MAEB 为 49.39。官方称其在 1B 参数以下的多模态嵌入模型中处于领先位置。这类开源 AI 模型 可下载权重后直接部署,不依赖云端接口。
EmbeddingGemma 2 与同类嵌入模型的对比
| 对比维度 | EmbeddingGemma 2 | WeMM-Embedding | Gemini Embedding 2 |
|---|---|---|---|
| 出品方 | 谷歌 DeepMind | 腾讯微信视觉团队 | 谷歌 DeepMind |
| 支持模态 | 文本·代码·图像·视频·音频 | 文本·图像·视频·视觉文档 | 文本·图像·视频·音频·PDF |
| 参数规格 | 740M | 2B / 4B / 9B | 未公开 |
| 输出维度 | 768(可截断至 128) | 2048 / 2560 / 4096 | 128–3072(推荐 768 / 1536 / 3072) |
| 上下文窗口 | 8K token | 32K token | 8,192 token |
| MMEB-v2 | 59.01 | 80.6(9B) | 未公开 |
| 开源与获取 | Apache-2.0 开放权重 | Apache-2.0 开放权重 | 闭源,API 调用 |
| 部署方式 | 端侧(全模态约 567MB) | 服务端(vLLM / SGLang) | 云端 API |
上表 EmbeddingGemma 2 与 Gemini Embedding 2 两列取自谷歌官方模型资料,WeMM-Embedding 一列取自腾讯微信视觉团队官方发布材料。三者的差异集中在体量与部署形态上:EmbeddingGemma 2 与 WeMM-Embedding 均开放权重,前者面向端侧、以 740M 参数换取内存占用,后者以 2B 到 9B 的参数规模换取检索精度,MMEB-v2 上 WeMM-Embedding 的 9B 档为 80.6;Gemini Embedding 2 以 API 形式提供,输入上限同为 8,192 token。多语言文本方面,EmbeddingGemma 2 的 MTEB 多语言 v2 得分为 61.36,代码任务为 78.68,音频检索 MSEB 为 69.54。
如果检索任务以纯文本为主,也可以参考 Nemotron 3 Embed(英伟达开源的文本向量嵌入模型,支持 32768 token 长文本输入与 2048 维向量,面向企业知识库与 RAG 检索场景)。
EmbeddingGemma 2 的应用场景与适用人群
该模型面向需要在本地完成语义检索与内容组织的任务,常见场景包括:
- 端侧语义检索:在手机或笔记本上对相册、文档与聊天记录建立向量索引,查询过程不离开本地设备。
- 检索增强生成:为本地知识库生成嵌入向量,供大语言模型在作答前召回相关片段。
- 跨模态内容管理:文本、图像、视频与音频共用一套向量空间,可用文字检索图片或视频片段。
- 分类与聚类:对客服反馈、评论或媒体素材按语义分组,或检测近似重复的内容。
适用人群:需要在端侧部署检索能力的开发者、构建本地知识库与 RAG 管线的团队,以及处理多模态素材的内容与运营人员。
EmbeddingGemma 2 的使用方法
模型权重与推理代码已开源,按以下顺序接入:
- 获取模型:在 EmbeddingGemma 2 官方模型页 查看许可说明与权重文件。
- 安装依赖:执行
pip install -U sentence-transformers transformers安装推理库。 - 加载模型:通过
SentenceTransformer("google/embeddinggemma-2")载入权重并生成向量。 - 选择精度:推理使用
bfloat16或float32,避免使用float16,该模型的激活值范围超出 float16 的动态范围,会返回 NaN 或静默退化的向量。 - 添加任务前缀:文本输入按用途附加
task: search result | query: {query}等前缀,图像、视频与音频不加前缀。 - 按需加载编码器:纯文本场景传入
{"vision_config": None, "audio_config": None},关闭视觉与音频编码器,显存占用降到文本骨干规模。
初次接入建议先用少量文本核对任务前缀与截断维度是否生效,再扩展到多模态语料。
EmbeddingGemma 2 的价格与开源情况
EmbeddingGemma 2 以 Apache-2.0 协议免费开放,权重与推理代码均可直接下载,商用不收取授权费用。谷歌未对该模型单独提供付费接口,使用成本主要来自本地部署所需的内存与显存。
模型全部权重开放下载,允许商用、修改与再分发,衍生作品需保留许可与署名。权重托管在 Hugging Face 与 Kaggle,官方同时计划将其上架 Gemini Enterprise Agent Platform Model Garden。
EmbeddingGemma 2 的常见问题
EmbeddingGemma 2 与第一代 EmbeddingGemma 有什么区别?
第一代仅支持文本嵌入,EmbeddingGemma 2 把输入扩展到代码、图像、视频与音频;上下文窗口由 2K 提升到 8,192 token;MTEB code 基准由 68.76 提升到 78.68。谷歌称第一代的下载量已超过 2000 万次。
EmbeddingGemma 2 与 Gemma 4 是什么关系?
EmbeddingGemma 2 沿用 Gemma 4 的架构设计与能力,但定位是嵌入模型而非生成模型:它不产出文本,只把输入编码为 768 维向量,供检索、分类、聚类与相似度计算使用。
EmbeddingGemma 2 支持哪些输入形式?
文本、图像、视频与音频可以出现在同一条输入中,共同占用 8,192 token 上下文。各类媒体按固定比例消耗 token 预算,单张图像约 280 token,视频每帧约 140 token,音频每秒约 25 token。
浙公网安备33010202004812号