WeMM-Embedding – 腾讯开源通用多模态Embedding模型
WeMM-Embedding是什么
WeMM-Embedding 是腾讯微信视觉团队开源的通用多模态 Embedding 模型家族,提供 2B/4B/9B 三种规格。模型将文本、图像、视频、视觉文档及交错多模态输入统一编码到共享向量空间,在 MMEB-v2 基准排行榜位列第一,并已在微信视频号、公众号、搜索等推荐与检索业务中大规模落地。

WeMM-Embedding的主要功能
-
多模态统一编码:支持文本、图像、视频、视觉文档及任意交错的多模态输入,统一映射到共享稠密向量空间。
-
灵活维度输出:基于 Matryoshka 表示学习,单次推理可输出 64 至 4096 维的嵌套向量,256 维即可保留近 99% 的全维性能。
-
多任务适配:覆盖检索、分类、问答、视觉定位、跨域匹配、Agent 工具/GUI/记忆检索等场景。
-
高效推理部署:支持 Transformers、Sentence Transformers、vLLM 和 SGLang 等多种框架,便于生产环境集成。
WeMM-Embedding的技术原理
- 架构设计:以 Qwen3.5 多模态大语言模型为骨干,通过在输入序列末尾追加
<embedding>特殊 token,取其最终层隐藏状态并经 L2 归一化得到输出表示,天然支持因果注意力下的任意交错多模态输入。 - 两阶段训练策略:第一阶段用数亿对异构数据建立通用多模态对齐空间;第二阶段在精选数据上结合硬负样本、重排序器监督和跨尺度 Embedding 蒸馏进行细粒度精炼,实现从广覆盖到高精度的渐进提升。
- 数据构建与精选:采用统一 Pair-Based 格式整合六大类监督数据;通过 Semantic-ID 引导的重采样平衡语义分布,利用多模态大模型自动过滤低质量样本并修正文本错误,同时针对文本、图像和视频分别构建显式硬负样本以增强判别能力。
- 训练目标体系:标准配对数据采用 InfoNCE 对比学习并引入重复感知掩码避免假负样本;分级相关性数据采用评分差距加权的 CoSENT 排序损失;Stage 2 中引入重排序器分数提供任务级细粒度监督,以 9B 模型为教师通过双向 KL 散度向小模型蒸馏软相似度分布。

微信关注回复“开源”,加入AI开源项目交流群
如何使用WeMM-Embedding
-
环境准备:克隆 GitHub 仓库并执行
pip install -r requirements.txt安装依赖,推荐使用transformers==5.2.0以保证结果可复现。 -
获取模型:从 Hugging Face 下载
WeMM-Embedding-2B/4B/9B的模型权重到本地。 -
Transformers 推理:运行
examples/transformers_inference.py,传入模型路径及文本/图像/视频路径,指定--dimension获取对应维度的 Embedding。 -
Sentence Transformers 推理:运行
examples/sentence_transformers_inference.py,可直接使用 Hugging Face 模型 ID,通过encode()统一编码多模态输入。 -
Matryoshka 降维:对全维向量取前
d维后,使用torch.nn.functional.normalize重新 L2 归一化,即可得到低维表示。 -
服务化部署:生产环境使用 vLLM(
--runner pooling)或 SGLang(--is-embedding)启动推理服务,支持高并发调用。
WeMM-Embedding的核心优势
-
极致参数效率:2B 模型即超越此前领先的 8B 开源基线,重新定义了多模态 Embedding 的性能-效率边界。
-
真正统一的多模态表示:原生支持文本、图像、视频、视觉文档及任意交错组合输入,无需为不同模态设计独立编码通路。
-
灵活的 Matryoshka 维度:单次推理即可输出 64 至 4096 维向量,256 维仍能保留近 99% 的全维性能,显著降低存储与检索成本。
-
经过大规模业务验证:已在微信视频号、公众号、搜索等核心业务的 14 项 A/B 测试中取得一致提升,并全量上线生产环境。
-
先进的渐进式训练:通过”大规模对齐+精选蒸馏”两阶段策略,结合 Semantic-ID 数据精选与跨尺度知识蒸馏,实现广覆盖与高精度的兼顾。
WeMM-Embedding的项目地址
- GitHub仓库:https://github.com/Tencent/WeMM-Embedding
- HuggingFace模型库:https://huggingface.co/collections/tencent/wemm-embedding
- arXiv技术论文:https://arxiv.org/pdf/2608.24053
WeMM-Embedding的同类竞品对比
| 对比维度 | WeMM-Embedding | Qwen3-VL-Embedding |
|---|---|---|
| 开发方 | 腾讯微信视觉团队 | 阿里巴巴通义千问团队 |
| 开源协议 | Apache 2.0 | Apache 2.0 |
| 模型规格 | 2B / 4B / 9B | 2B / 8B |
| 支持模态 | 文本、图像、视频、视觉文档、交错多模态 | 文本、图像、视频、视觉文档、交错多模态 |
| 音频支持 | 暂不支持 | 暂不支持 |
| MMEB-v2 均分 | 77.9 / 79.2 / 80.6 | 73.2 / 77.8 |
| MMEB-v3 均分 | 56.0 / 58.2 / 59.5 | 50.9 / 53.5 |
| 维度灵活性 | Matryoshka(64~4096 维,单次推理多维度输出) | 固定维度输出 |
| 核心架构 | Qwen3.5 + 两阶段训练(对齐+精选蒸馏) | Qwen3-VL + 对比学习 |
| 生产验证 | 已大规模部署于微信视频号、公众号、搜索、电商 | 主要面向研究/开发者社区 |
WeMM-Embedding的应用场景
-
跨模态语义检索:模型支持以文搜图、以图搜文、以文搜视频等任意方向的跨模态检索,适用内容平台的海量素材库查找与版权监测。
-
个性化推荐系统:将图文、视频内容编码为统一向量,用于候选召回、用户兴趣序列建模与跨域内容匹配,已落地于微信视频号、公众号及电商推荐场景。
-
视觉文档理解与检索:对 PDF、图表、发票、截图等视觉文档进行向量化,支撑智能文档问答、票据归档检索及企业知识库构建。
-
AI Agent 工具与记忆检索:为 Agent 提供工具调用检索、GUI 界面元素定位及长程记忆检索能力,支持复杂任务规划与多步骤交互。
-
多模态内容分类与审核:将图像、视频内容映射到语义空间,实现物体识别、场景分类、动作检测及违规内容相似度比对与聚类分析。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号