微信 AI 团队近日宣布,面向全球开源通用多模态嵌入模型 WeMM-Embedding,并同步发布 2B、4B 和 9B 三种参数规模的版本。该模型突破传统单模态限制,可同时处理文本、图像、视频及复杂视觉文档,支持多模态混合输入的直接解析与语义对齐,在跨模态内容理解领域展现出显著技术优势。
核心技术创新方面,研发团队构建了多模态同构语义空间架构。通过深度神经网络将不同模态数据映射至统一向量空间,实现文字、图片、视频等异构信息的语义等价转换。这种设计使模型能够直接比较不同模态内容的相似度,为跨模态检索提供底层技术支撑。在 MMEB-v2 国际权威评估中,该模型以显著优势超越同期开源及商业方案,刷新多模态检索任务基准纪录。
实际应用层面,WeMM-Embedding 已深度融入微信生态核心业务场景。朋友圈图文搜索、视频号内容推荐、公众号精准分发及电商商品匹配等高频功能均采用该模型作为语义理解引擎。据内部数据显示,模型日均处理请求量突破 10 亿次,在复杂场景下的检索准确率较传统方案提升 37%,响应延迟降低至 85 毫秒以内。
为促进技术生态发展,微信团队同步开放完整技术栈资源。开发者可通过开源代码库获取模型训练框架与部署工具,在指定模型平台下载预训练权重文件。技术文档详细披露了模型架构设计、训练数据构建及多模态对齐算法等关键细节,为学术研究与工业应用提供可复现的技术路径。














