← 最新论文
🤖 AI

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

本文介绍了 Pailitao-MMSearch,这是一个基于 Qwen 构建的原生电商多模态搜索基础模型,它通过集成混合语义 ID(Hybrid Semantic IDs)、两阶段持续预训练策略以及混合推理后训练流水线,克服了孤立单模态模型和通用视觉语言模型的局限性,并在淘宝平台上实现了高达 +13.61% 的 GMV 提升,取得了显著的商业收益。

原作者: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xi
发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一个巨大的、无限的数字购物中心里。在过去,如果你想找一件特定的衬衫,你必须在搜索框中输入非常具体的描述,比如“红色棉质 T 恤”。如果你想找一双和你街头看到的图片相匹配的鞋子,你必须拍张照片,然后寄希望于计算机能猜出你在找什么。很长一段时间以来,计算机就像是专门的工人:一个工人只懂文本,另一个只懂图片,第三个只懂语音。它们彼此并不沟通。如果你给它一个图片加一段文字的混合指令,它们就会感到困惑,经常会忽略你的文字或者遗漏照片中的细节。

另一方面,也存在一些超级聪明的通用型计算机,它们可以看一张照片并为此写一首诗。但这些通才就像是购物中心里的游客;它们知道什么是“衬衫”这个概念,但不知道“丝绸混纺”和“100% 棉”之间的区别,也不知道买特定相机的人通常也会买特定类型的镜头。它们缺乏关于购物实际运作方式的深度内部知识。科学家们面临的重大问题是:我们如何构建一台既是超级购物达人(了解产品每一个微小细节以及人们喜好),又是优秀的对话者(理解复杂的混合指令),同时还能保持思考和推理能力的单一超级智能计算机?

这正是 Pailitao-MMSearch 背后的团队致力于解决的问题。他们构建了一种全新的“搜索大脑”,专为电子商务设计。他们没有使用分离的工具来处理图片和文字,而是创建了一个单一的模型,该模型可以查看照片、阅读杂乱的文本描述,并瞬间生成一份完美的商品列表。他们不仅仅是微调了一个现有模型;他们教会了它一种新的“产品语言”,用数百万种购物习惯对其进行训练,并仔细打磨了它的推理能力,以确保它不会忘记如何保持聪明。

问题所在:“拼凑式”商店 vs. “游客型”导游

作者指出,目前的在线购物系统有点混乱。大多数大型商店使用一种“拼凑式”方法。如果你用照片搜索,一个专门的图像查找器会寻找相似图片;如果你输入文字,一个文本查找器会寻找匹配标题。如果你说“找一件像这张照片里的红裙子,但要长袖的”,系统必须尴尬地将你的请求拆分成碎片,发送给不同的工人,然后尝试将结果重新粘合在一起。这既缓慢又复杂,而且经常会偏离重点,因为这些“工人”并不理解图片和文字是如何协同工作的。

或者,也有“游客型”导游(通用 AI 模型)。它们非常擅长理解世界,但并不了解购物中心的具体规则。它们可能意识不到“丝绸”和“缎面”是不同的,或者不知道买手机壳的用户很可能会寻找屏幕保护贴。它们也无法直接指向目录中某个特定的产品;它们通常需要一个单独的工具来完成这项工作,这破坏了流程的连贯性。

解决方案:一种新的产品语言

为了解决这个问题,团队创建了 Pailitao-MMSearch,这是一个原生的电商搜索基础模型。可以把它想象成训练一名能够流利使用购物中心语言的新员工。

1. 混合 ID (HybSID):既是“邮编”也是“肖像”
向计算机描述产品的最大挑战是什么?想象你有一个拥有数十亿本书的图书馆。如果你只给它们一个“邮编”(例如“小说 - 推理”),你会得到一大堆书,但无法找到你想要的那一本。如果你只给它们一个“肖像”(详细的描述),则很难高效地组织它们。

团队发明了 HybSID(混合语义 ID)。这就像是同时给每个产品两个 ID:

  • 邮编 (离散代码): 一个简短、简单的代码,将产品归入广泛的类别(例如“夏季连衣裙”)。这有助于计算机快速缩小搜索范围。
  • 肖像 (连续嵌入): 一个详细、高分辨率的产品“肖像”,捕捉如精确的蓝色色调、织物纹理或特定品牌 Logo 等微小细节。

通过结合这两者,模型可以快速找到正确的“产品社区”,然后挑选出完全符合用户特定、模糊描述的那个精准单品。

2. 两阶段训练:学习购物规律,同时保留大脑
教一个通用 AI 成为购物专家是有风险的。如果你只是喂给它数百万个产品描述,它可能会忘记如何进行正常的语言交流或逻辑推理。这被称为“灾难性遗忘”。

团队使用了一种巧妙的两步训练过程:

  • 第一阶段(实习期): 他们教会了模型关于购物的一切:产品细节、人们如何浏览以及哪些物品可以搭配使用。他们还加入了一些正常的对话数据,以防止模型变得过于痴迷于产品本身。
  • 第二阶段(导师制): 他们注意到模型在通用推理方面变得有些“生锈”了。因此,他们使用原始的、聪明的模型版本作为“导师”。他们让新模型在导师的监督下练习通用任务,通过导师的温和纠正,确保它不会失去思考和遵循复杂指令的能力。这确保了最终的模型既是购物专家,又是聪明的对话者。

3. 推理引擎:先思考,后表达
购物并不总是简单的。有时你会说:“我想要一件像这样的一件裙子,但要是海军蓝色的,并且要适合参加婚礼。”这是一个复杂的请求。
团队教会了模型使用思维链 (Chain-of-Thought) 来处理难题。模型不再仅仅是猜测答案,而是学会了将问题分解:

  1. 分析照片: “这是一件碎花裙。”
  2. 阅读请求: “将颜色改为海军蓝,将风格改为正式。”
  3. 寻找匹配: “好的,我需要一件海军蓝、正式款的碎花裙。”
    对于简单问题,它会跳过思考过程,直接给出答案以节省时间。

结果:现实世界的成功

团队不仅是在实验室里测试,他们还将该系统部署在了服务于数千万日活用户的 淘宝 Pailitao 平台上。他们进行了一次大规模测试(A/B 测试),其中一部分用户使用旧的搜索系统,另一部分用户则使用新的 Pailitao-MMSearch。

结果令人印象深刻。新系统实现了:

  • 总成交额 (GMV) 增长了 13.61%
  • 交易量增加了 8.21%

这表明,当计算机真正理解你的意思——结合你的照片、你的文字以及你的购物习惯时——它能帮助你找到真正想要的东西,从而让你产生更多的购买行为。

未来展望

作者承认该系统目前尚不完美。如果用户上传了一张角度奇特的模糊照片,或者写了一句充满错别字的句子,模型仍然可能会感到困惑。他们计划让模型在处理这些混乱的现实情况时具备更强的推理能力。他们还看到了一个未来,即这种智能搜索模型将成为自主购物智能体的“大脑”,能够执行多步骤任务,比如寻找一套穿搭、检查天气,并一站式完成下单。

简而言之,Pailitao-MMSearch 是迈向一种全新购物体验的一步,在这种体验中,计算机不仅仅是匹配关键词,而是能够真正理解你的意图、你的风格以及你的需求,并在一次流畅的对话中完成这一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →