WeMM-Embedding是一款由腾讯微信视觉团队于 2026 年 8 月推出的通用多模态 Embedding 检索与表示模型,基于 Qwen3.5 训练,把文本、图像、视频与视觉文档统一编码到同一向量空间,可用于多模态检索、RAG 召回与内容理解,并已在微信视频号、公众号与微信搜索的检索场景落地验证。
| 基础信息 | 内容 |
|---|---|
| 开发团队 | 腾讯微信视觉团队(WeChat Vision) |
| 发布时间 | 2026 年 8 月 25 日 |
| 产品定位 | 通用多模态 Embedding 检索与表示模型 |
| 基础模型 | 基于 Qwen3.5 训练 |
| 模型规模 | 2B / 4B / 9B 三档可选 |
| 开源协议 | Apache-2.0 |
| 支持模态 | 文本、图像、视频、视觉文档(PDF / 网页截图) |
| 关键评测 | MMEB-v2 9B 档 80.6 分,位列同规模前列 |

WeMM-Embedding 的核心能力
与偏重生成的 Qwen3.8-Flash 等多模态模型不同,WeMM-Embedding 把重心放在”表示”而非”生成”:它要做的是把不同模态的内容投射到同一个可比较的向量空间,从而让一条查询就能在文本、图片、视频与文档之间跨模态召回。
统一多模态编码器架构
WeMM-Embedding 以 Qwen3.5 为骨干,通过大规模多模态对齐训练,把文本、图像、视频帧与视觉文档(PDF、网页截图)映射到统一向量空间;同时支持 Matryoshka 表示学习,允许把高维向量截断到更小维度而不明显损失检索质量,方便在存储与算力受限的场景下降本。模型提供 2B / 4B / 9B 三档,覆盖从端侧到服务端的部署需求。
四项关键能力
- 多模态统一编码:文本 / 图像 / 视频 / 视觉文档映射到同一空间,跨模态检索免额外对齐
- Matryoshka 弹性维度:支持截断到更小维度,降低向量存储与检索的计算成本
- 长文档与视觉文档:直接编码 PDF、网页截图类视觉文档,适配文档型 RAG 检索
- 已落地微信生态:视频号、公众号、微信搜索的检索链路已做接入验证
在实际工程中,统一向量空间带来的直接好处是”一次编码、处处可用”:同一份向量既能服务文本检索,也能服务以图搜文、以文搜视频等跨模态查询,不必为每种模态单独维护一套索引。配合 Matryoshka 维度截断,还能在召回质量与存储成本之间做灵活权衡。
WeMM-Embedding 与主流多模态 Embedding 模型对比
把 WeMM-Embedding 与当前主流的多模态 / 文本 Embedding 方案放在一起比较,可以更直观看到它在”视频 + 视觉文档”统一编码与开源权重上的位置。对比聚焦团队、模态、规模、基准与协议五个维度。
| 对比维度 | WeMM-Embedding | Gemini Embedding 2 | Nemotron 3 Embed |
|---|---|---|---|
| 所属团队 | 腾讯微信视觉团队 | Google DeepMind | 英伟达(NVIDIA) |
| 发布时间 | 2026 年 8 月 25 日 | 2025 年(多模态版) | 2025 年 |
| 支持模态 | 文本 / 图像 / 视频 / 视觉文档 | 文本 / 图像 | 文本为主 |
| 模型规模 | 2B / 4B / 9B | 未公开多档 | 多档文本向量 |
| 关键基准 | MMEB-v2 9B 80.6 | MMEB-v2 前列 | MTEB 文本检索前列 |
| 开源协议 | Apache-2.0 | 闭源 API | 开源(类 OpenRA1) |
注:对比数据来自各模型官方 README 与公开榜单(MMEB-v2 / MTEB),仅作横向参考。
从官方数据可以看出,WeMM-Embedding 是少数把”视频 + 视觉文档”也纳入统一编码的开源多模态 Embedding 模型,2B / 4B / 9B 三档覆盖从端侧到服务端的部署需求,9B 在 MMEB-v2 取得 80.6 分、与同规模闭源 / 开源方案同档竞争;对需要中文多模态检索的 RAG 场景尤其友好,可直接接入现有向量库。
相关站内参考:GLM-5.3-Flash、Nemotron 3 Embed。
如果你的业务以文本检索为主,Nemotron 3 Embed 等文本向量方案已足够;但当检索对象扩展到截图、视频帧或带版式的 PDF 时,WeMM-Embedding 的统一编码会显著减少跨模态对齐的工程负担,这也是它相对 Gemini Embedding 2 等闭源方案更值得关注的原因。
在与 Gemini Embedding 2 这类闭源多模态嵌入方案对照时,WeMM-Embedding 的开源权重与中文多模态覆盖是其最直观的差异化优势。
WeMM-Embedding 的应用场景与适用人群
结合官方资料与落地情况说明,WeMM-Embedding 更偏向检索型与知识型场景,例如电商与媒体平台常用它做商品图与详情文的联合召回,教育场景用它做课件 PDF 与讲解视频的联动检索,因此适用人群与传统”生成类”多模态模型略有差异。
- 多模态文档检索:企业知识库把 PDF、网页截图与文本统一向量化,用一条查询跨模态召回
- 视频内容理解与搜索:视频 / 短视频平台用帧 + 字幕联合编码,实现以图搜视频、以文搜片段
- RAG 增强问答:把长文档的视觉与文本信息统一进检索池,降低多模态问答的漏召率
适用人群:搭建多模态 RAG 的算法工程师、企业知识库与搜索团队、内容平台检索架构师、做跨模态推荐的算法同学,以及需要把图像 / 视频纳入向量检索的高校研究者。对中文场景与微信生态内的检索需求尤为契合。
如何使用 WeMM-Embedding
使用前的环境准备
- 运行环境:Python 3.10+、PyTorch 2.1+,GPU 显存按所选档位准备(2B 约 6GB、9B 约 20GB)
- 权重来源:需能访问 Hugging Face / ModelScope,用于下载 2B / 4B / 9B 模型权重
快速接入步骤
- 安装依赖:执行 pip install transformers accelerate,并克隆官方仓库到本地
- 下载权重:从 Hugging Face 或 ModelScope 拉取对应档位(2B / 4B / 9B)的 WeMM-Embedding 权重
- 编码多模态输入:用官方示例把文本、图像、视频帧与视觉文档统一送入模型得到同维度向量
- 接入检索:将向量写入 FAISS / Milvus 等向量库,按相似度召回完成多模态检索
完整接口说明、示例脚本与最新基准请参考 WeMM-Embedding 官方仓库。
WeMM-Embedding 的价格与开源情况
WeMM-Embedding 以 Apache-2.0 协议完全开源,2B / 4B / 9B 三档权重与推理代码已在 GitHub、Hugging Face 与 ModelScope 同步开放,研究、学习与商业集成均可免费下载使用,商用无授权费。
模型基于 Qwen3.5 训练,二次开发与再分发需保留版权与许可证声明;实际落地需自行承担算力与部署成本,中文多模态检索、视频号与公众号类场景可直接接入现有向量库,无需额外付费。
WeMM-Embedding 常见问题
WeMM-Embedding 与文本 Embedding 模型(如 Nemotron 3 Embed)有什么差异?
WeMM-Embedding 是统一多模态 Embedding,除文本外还能编码图像、视频与视觉文档到同一向量空间,支持跨模态检索;Nemotron 3 Embed 以文本向量检索为主,跨模态能力有限,两者适用场景不同。
WeMM-Embedding 支持哪些模态的联合检索?
官方支持文本、图像、视频与视觉文档(PDF / 网页截图)四类,可把不同模态映射到统一空间后做相似度召回,无需额外对齐模块。
9B 档的部署显存大概多少?
9B 档推理约需 20GB 级显存,2B 档可降到约 6GB,适合端侧或轻量服务;具体随框架与精度(FP16 / INT8)浮动。
WeMM-Embedding 能否商用?
Apache-2.0 协议允许商用,微信生态外的业务也可接入;建议保留版权声明并关注官方更新与许可条款。
浙公网安备33010202004812号