你拿一张商品图去搜索,想同时找到说明文字、演示视频和图文手册,传统系统往往要分头处理。WeMM-Embedding想把这几扇门合成一个入口:它不直接回答问题,而是把不同媒介转成Embedding——一串代表内容含义的数字,让语义相近的材料在数学空间里靠得更近,方便搜索与RAG(先找资料、再让模型作答)调用。
据腾讯Hugging Face模型页,WeMM-Embedding提供2B、4B和9B三个版本,均以Qwen3.5为基础。其中9B版可接收文本、图片、视频、视觉文档和图文交错输入,统一输出4096维、经过L2归一化的向量——简单说,就是把向量长度拉到同一尺度,便于跨媒介排序。它还支持截取较短向量,以降低存储和检索成本。
值得关注的不是又多了一种输入,而是这些输入终于能共用一套检索坐标:RAG的资料库可以从纯文本继续扩到视频和复杂文档。边界也很明确:官方称其不支持音频,现有材料也未提供可独立核查的效果数字。