WeMM-Embedding – 腾讯开源的通用多模态Embedding模型

AI模型6天前更新 智小研
45 0

WeMM-Embedding是一款由腾讯微信视觉团队于 2026 年 8 月推出的通用多模态 Embedding 检索与表示模型,基于 Qwen3.5 训练,把文本、图像、视频与视觉文档统一编码到同一向量空间,可用于多模态检索、RAG 召回与内容理解,并已在微信视频号、公众号与微信搜索的检索场景落地验证。

基础信息内容
开发团队腾讯微信视觉团队(WeChat Vision)
发布时间2026 年 8 月 25 日
产品定位通用多模态 Embedding 检索与表示模型
基础模型基于 Qwen3.5 训练
模型规模2B / 4B / 9B 三档可选
开源协议Apache-2.0
支持模态文本、图像、视频、视觉文档(PDF / 网页截图)
关键评测MMEB-v2 9B 档 80.6 分,位列同规模前列
WeMM-Embedding – 腾讯开源的通用多模态Embedding模型

WeMM-Embedding 的核心能力

与偏重生成的 Qwen3.8-Flash 等多模态模型不同,WeMM-Embedding 把重心放在”表示”而非”生成”:它要做的是把不同模态的内容投射到同一个可比较的向量空间,从而让一条查询就能在文本、图片、视频与文档之间跨模态召回。

统一多模态编码器架构

WeMM-Embedding 以 Qwen3.5 为骨干,通过大规模多模态对齐训练,把文本、图像、视频帧与视觉文档(PDF、网页截图)映射到统一向量空间;同时支持 Matryoshka 表示学习,允许把高维向量截断到更小维度而不明显损失检索质量,方便在存储与算力受限的场景下降本。模型提供 2B / 4B / 9B 三档,覆盖从端侧到服务端的部署需求。

四项关键能力

  • 多模态统一编码:文本 / 图像 / 视频 / 视觉文档映射到同一空间,跨模态检索免额外对齐
  • Matryoshka 弹性维度:支持截断到更小维度,降低向量存储与检索的计算成本
  • 长文档与视觉文档:直接编码 PDF、网页截图类视觉文档,适配文档型 RAG 检索
  • 已落地微信生态:视频号、公众号、微信搜索的检索链路已做接入验证

在实际工程中,统一向量空间带来的直接好处是”一次编码、处处可用”:同一份向量既能服务文本检索,也能服务以图搜文、以文搜视频等跨模态查询,不必为每种模态单独维护一套索引。配合 Matryoshka 维度截断,还能在召回质量与存储成本之间做灵活权衡。

WeMM-Embedding 与主流多模态 Embedding 模型对比

把 WeMM-Embedding 与当前主流的多模态 / 文本 Embedding 方案放在一起比较,可以更直观看到它在”视频 + 视觉文档”统一编码与开源权重上的位置。对比聚焦团队、模态、规模、基准与协议五个维度。

对比维度WeMM-EmbeddingGemini Embedding 2Nemotron 3 Embed
所属团队腾讯微信视觉团队Google DeepMind英伟达(NVIDIA)
发布时间2026 年 8 月 25 日2025 年(多模态版)2025 年
支持模态文本 / 图像 / 视频 / 视觉文档文本 / 图像文本为主
模型规模2B / 4B / 9B未公开多档多档文本向量
关键基准MMEB-v2 9B 80.6MMEB-v2 前列MTEB 文本检索前列
开源协议Apache-2.0闭源 API开源(类 OpenRA1)

注:对比数据来自各模型官方 README 与公开榜单(MMEB-v2 / MTEB),仅作横向参考。

从官方数据可以看出,WeMM-Embedding 是少数把”视频 + 视觉文档”也纳入统一编码的开源多模态 Embedding 模型,2B / 4B / 9B 三档覆盖从端侧到服务端的部署需求,9B 在 MMEB-v2 取得 80.6 分、与同规模闭源 / 开源方案同档竞争;对需要中文多模态检索的 RAG 场景尤其友好,可直接接入现有向量库。

相关站内参考:GLM-5.3-FlashNemotron 3 Embed

如果你的业务以文本检索为主,Nemotron 3 Embed 等文本向量方案已足够;但当检索对象扩展到截图、视频帧或带版式的 PDF 时,WeMM-Embedding 的统一编码会显著减少跨模态对齐的工程负担,这也是它相对 Gemini Embedding 2 等闭源方案更值得关注的原因。

在与 Gemini Embedding 2 这类闭源多模态嵌入方案对照时,WeMM-Embedding 的开源权重与中文多模态覆盖是其最直观的差异化优势。

WeMM-Embedding 的应用场景与适用人群

结合官方资料与落地情况说明,WeMM-Embedding 更偏向检索型与知识型场景,例如电商与媒体平台常用它做商品图与详情文的联合召回,教育场景用它做课件 PDF 与讲解视频的联动检索,因此适用人群与传统”生成类”多模态模型略有差异。

  • 多模态文档检索:企业知识库把 PDF、网页截图与文本统一向量化,用一条查询跨模态召回
  • 视频内容理解与搜索:视频 / 短视频平台用帧 + 字幕联合编码,实现以图搜视频、以文搜片段
  • RAG 增强问答:把长文档的视觉与文本信息统一进检索池,降低多模态问答的漏召率

适用人群:搭建多模态 RAG 的算法工程师、企业知识库与搜索团队、内容平台检索架构师、做跨模态推荐的算法同学,以及需要把图像 / 视频纳入向量检索的高校研究者。对中文场景与微信生态内的检索需求尤为契合。

如何使用 WeMM-Embedding

使用前的环境准备

  • 运行环境:Python 3.10+、PyTorch 2.1+,GPU 显存按所选档位准备(2B 约 6GB、9B 约 20GB)
  • 权重来源:需能访问 Hugging Face / ModelScope,用于下载 2B / 4B / 9B 模型权重

快速接入步骤

  1. 安装依赖:执行 pip install transformers accelerate,并克隆官方仓库到本地
  2. 下载权重:从 Hugging Face 或 ModelScope 拉取对应档位(2B / 4B / 9B)的 WeMM-Embedding 权重
  3. 编码多模态输入:用官方示例把文本、图像、视频帧与视觉文档统一送入模型得到同维度向量
  4. 接入检索:将向量写入 FAISS / Milvus 等向量库,按相似度召回完成多模态检索

完整接口说明、示例脚本与最新基准请参考 WeMM-Embedding 官方仓库

WeMM-Embedding 的价格与开源情况

WeMM-Embedding 以 Apache-2.0 协议完全开源,2B / 4B / 9B 三档权重与推理代码已在 GitHub、Hugging Face 与 ModelScope 同步开放,研究、学习与商业集成均可免费下载使用,商用无授权费。

模型基于 Qwen3.5 训练,二次开发与再分发需保留版权与许可证声明;实际落地需自行承担算力与部署成本,中文多模态检索、视频号与公众号类场景可直接接入现有向量库,无需额外付费。

WeMM-Embedding 常见问题

WeMM-Embedding 与文本 Embedding 模型(如 Nemotron 3 Embed)有什么差异?

WeMM-Embedding 是统一多模态 Embedding,除文本外还能编码图像、视频与视觉文档到同一向量空间,支持跨模态检索;Nemotron 3 Embed 以文本向量检索为主,跨模态能力有限,两者适用场景不同。

WeMM-Embedding 支持哪些模态的联合检索?

官方支持文本、图像、视频与视觉文档(PDF / 网页截图)四类,可把不同模态映射到统一空间后做相似度召回,无需额外对齐模块。

9B 档的部署显存大概多少?

9B 档推理约需 20GB 级显存,2B 档可降到约 6GB,适合端侧或轻量服务;具体随框架与精度(FP16 / INT8)浮动。

WeMM-Embedding 能否商用?

Apache-2.0 协议允许商用,微信生态外的业务也可接入;建议保留版权声明并关注官方更新与许可条款。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章