EmbeddingGemma 2 – 谷歌DeepMind推出的开源多模态嵌入模型

AI模型9小时前更新 老高
8 0

EmbeddingGemma 2是一款由谷歌DeepMind于2026年10月推出的开源多模态嵌入模型,主要用于把文本、代码、图像、视频与音频映射到统一的向量空间,支持 768 维输出与 8,192 token 上下文,适用于端侧语义检索、检索增强生成与内容聚类等方向。

基础信息内容
产品定位开源多模态嵌入模型
出品方谷歌 DeepMind
发布时间2026年10月6日
总参数量740M(文本270M+视觉170M+音频300M)
输出维度768(可截断至 128/256/512)
上下文窗口8,192 token
支持模态文本、代码、图像、视频、音频
开源协议Apache-2.0
部署方式端侧部署(支持选择性加载编码器)
EmbeddingGemma 2 – 谷歌DeepMind推出的开源多模态嵌入模型

EmbeddingGemma 2 的核心能力

EmbeddingGemma 2 由谷歌DeepMind在 Gemma 4 的架构基础上构建,把文本(含代码)、图像、视频与音频编码到同一个 768 维向量空间,用于语义检索、分类、聚类与相似度计算。权重以 Apache-2.0 协议开放,可在手机与笔记本等消费级硬件上运行。

统一的多模态向量空间

模型把四类模态映射到同一向量空间,文本、图像、视频与音频可以出现在同一条输入中。文本部分用占位标记各类媒体的位置,整条输入共享 8,192 token 上下文;一次调用返回一个嵌入向量,可直接与任何其他 EmbeddingGemma 2 向量比较。

面向端侧的轻量设计

模型总参数 740M,由 270M 的文本骨干、170M 的视觉编码器与 300M 的音频编码器组成。两个模态编码器可按需关闭:仅加载文本部分时为 270M,文本加图像为 440M,文本加音频为 570M,完整多模态为 740M。官方给出的端侧数据显示,量化后在 Pixel 11 Pro 上运行纯文本权重约需 191MB 内存,完整多模态模型约需 567MB。

Matryoshka 截断与存储优化

输出向量默认 768 维,采用 Matryoshka 表示学习训练,可按需截断到 512、256 或 128 维。官方实测在 256 维时质量接近无损,128 维更适合纯文本任务,向量存储与内存占用最高可降至六分之一。截断后的向量需重新做 L2 归一化,查询端与文档端也必须使用相同维度,否则相似度排序会失真。

多语言与代码能力

模型覆盖 100 种以上语言,预训练语料包含 140 种以上语言的内容。与前代相比,代码任务的提升最明显:MTEB code 基准由 68.76 提升到 78.68,提高 9.92 分;文本侧 MTEB 多语言 v2 得分为 61.36,与前代的 61.15 基本持平。官方把这一变化指向本地代码库索引、语义代码搜索与编程代理检索。

检索与多模态基准表现

在 768 维输出下,模型的 MMEB v2 综合得分为 59.01,图像检索 MIEB lite 为 64.64,视觉文档 MMEB v2 为 67.84,视频 MMEB v2 为 50.67,音频检索 MSEB 为 69.54,音频理解 MAEB 为 49.39。官方称其在 1B 参数以下的多模态嵌入模型中处于领先位置。这类开源 AI 模型 可下载权重后直接部署,不依赖云端接口。

EmbeddingGemma 2 与同类嵌入模型的对比

对比维度EmbeddingGemma 2WeMM-EmbeddingGemini Embedding 2
出品方谷歌 DeepMind腾讯微信视觉团队谷歌 DeepMind
支持模态文本·代码·图像·视频·音频文本·图像·视频·视觉文档文本·图像·视频·音频·PDF
参数规格740M2B / 4B / 9B未公开
输出维度768(可截断至 128)2048 / 2560 / 4096128–3072(推荐 768 / 1536 / 3072)
上下文窗口8K token32K token8,192 token
MMEB-v259.0180.6(9B)未公开
开源与获取Apache-2.0 开放权重Apache-2.0 开放权重闭源,API 调用
部署方式端侧(全模态约 567MB)服务端(vLLM / SGLang)云端 API

上表 EmbeddingGemma 2 与 Gemini Embedding 2 两列取自谷歌官方模型资料,WeMM-Embedding 一列取自腾讯微信视觉团队官方发布材料。三者的差异集中在体量与部署形态上:EmbeddingGemma 2 与 WeMM-Embedding 均开放权重,前者面向端侧、以 740M 参数换取内存占用,后者以 2B 到 9B 的参数规模换取检索精度,MMEB-v2 上 WeMM-Embedding 的 9B 档为 80.6;Gemini Embedding 2 以 API 形式提供,输入上限同为 8,192 token。多语言文本方面,EmbeddingGemma 2 的 MTEB 多语言 v2 得分为 61.36,代码任务为 78.68,音频检索 MSEB 为 69.54。

如果检索任务以纯文本为主,也可以参考 Nemotron 3 Embed(英伟达开源的文本向量嵌入模型,支持 32768 token 长文本输入与 2048 维向量,面向企业知识库与 RAG 检索场景)。

EmbeddingGemma 2 的应用场景与适用人群

该模型面向需要在本地完成语义检索与内容组织的任务,常见场景包括:

  • 端侧语义检索:在手机或笔记本上对相册、文档与聊天记录建立向量索引,查询过程不离开本地设备。
  • 检索增强生成:为本地知识库生成嵌入向量,供大语言模型在作答前召回相关片段。
  • 跨模态内容管理:文本、图像、视频与音频共用一套向量空间,可用文字检索图片或视频片段。
  • 分类与聚类:对客服反馈、评论或媒体素材按语义分组,或检测近似重复的内容。

适用人群:需要在端侧部署检索能力的开发者、构建本地知识库与 RAG 管线的团队,以及处理多模态素材的内容与运营人员。

EmbeddingGemma 2 的使用方法

模型权重与推理代码已开源,按以下顺序接入:

  1. 获取模型:在 EmbeddingGemma 2 官方模型页 查看许可说明与权重文件。
  2. 安装依赖:执行 pip install -U sentence-transformers transformers 安装推理库。
  3. 加载模型:通过 SentenceTransformer("google/embeddinggemma-2") 载入权重并生成向量。
  4. 选择精度:推理使用 bfloat16 或 float32,避免使用 float16,该模型的激活值范围超出 float16 的动态范围,会返回 NaN 或静默退化的向量。
  5. 添加任务前缀:文本输入按用途附加 task: search result | query: {query} 等前缀,图像、视频与音频不加前缀。
  6. 按需加载编码器:纯文本场景传入 {"vision_config": None, "audio_config": None},关闭视觉与音频编码器,显存占用降到文本骨干规模。

初次接入建议先用少量文本核对任务前缀与截断维度是否生效,再扩展到多模态语料。

EmbeddingGemma 2 的价格与开源情况

EmbeddingGemma 2 以 Apache-2.0 协议免费开放,权重与推理代码均可直接下载,商用不收取授权费用。谷歌未对该模型单独提供付费接口,使用成本主要来自本地部署所需的内存与显存。

模型全部权重开放下载,允许商用、修改与再分发,衍生作品需保留许可与署名。权重托管在 Hugging Face 与 Kaggle,官方同时计划将其上架 Gemini Enterprise Agent Platform Model Garden。

EmbeddingGemma 2 的常见问题

EmbeddingGemma 2 与第一代 EmbeddingGemma 有什么区别?

第一代仅支持文本嵌入,EmbeddingGemma 2 把输入扩展到代码、图像、视频与音频;上下文窗口由 2K 提升到 8,192 token;MTEB code 基准由 68.76 提升到 78.68。谷歌称第一代的下载量已超过 2000 万次。

EmbeddingGemma 2 与 Gemma 4 是什么关系?

EmbeddingGemma 2 沿用 Gemma 4 的架构设计与能力,但定位是嵌入模型而非生成模型:它不产出文本,只把输入编码为 768 维向量,供检索、分类、聚类与相似度计算使用。

EmbeddingGemma 2 支持哪些输入形式?

文本、图像、视频与音频可以出现在同一条输入中,共同占用 8,192 token 上下文。各类媒体按固定比例消耗 token 预算,单张图像约 280 token,视频每帧约 140 token,音频每秒约 25 token。

© 版权声明

相关文章