Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation
本文介绍了 Pailitao-MMSearch,这是一个基于 Qwen 构建的原生电商多模态搜索基础模型,它通过集成混合语义 ID(Hybrid Semantic IDs)、两阶段持续预训练策略以及混合推理后训练流水线,克服了孤立单模态模型和通用视觉语言模型的局限性,并在淘宝平台上实现了高达 +13.61% 的 GMV 提升,取得了显著的商业收益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一个巨大的、无限的数字购物中心里。在过去,如果你想找一件特定的衬衫,你必须在搜索框中输入非常具体的描述,比如“红色棉质 T 恤”。如果你想找一双和你街头看到的图片相匹配的鞋子,你必须拍张照片,然后寄希望于计算机能猜出你在找什么。很长一段时间以来,计算机就像是专门的工人:一个工人只懂文本,另一个只懂图片,第三个只懂语音。它们彼此并不沟通。如果你给它一个图片加一段文字的混合指令,它们就会感到困惑,经常会忽略你的文字或者遗漏照片中的细节。
另一方面,也存在一些超级聪明的通用型计算机,它们可以看一张照片并为此写一首诗。但这些通才就像是购物中心里的游客;它们知道什么是“衬衫”这个概念,但不知道“丝绸混纺”和“100% 棉”之间的区别,也不知道买特定相机的人通常也会买特定类型的镜头。它们缺乏关于购物实际运作方式的深度内部知识。科学家们面临的重大问题是:我们如何构建一台既是超级购物达人(了解产品每一个微小细节以及人们喜好),又是优秀的对话者(理解复杂的混合指令),同时还能保持思考和推理能力的单一超级智能计算机?
这正是 Pailitao-MMSearch 背后的团队致力于解决的问题。他们构建了一种全新的“搜索大脑”,专为电子商务设计。他们没有使用分离的工具来处理图片和文字,而是创建了一个单一的模型,该模型可以查看照片、阅读杂乱的文本描述,并瞬间生成一份完美的商品列表。他们不仅仅是微调了一个现有模型;他们教会了它一种新的“产品语言”,用数百万种购物习惯对其进行训练,并仔细打磨了它的推理能力,以确保它不会忘记如何保持聪明。
问题所在:“拼凑式”商店 vs. “游客型”导游
作者指出,目前的在线购物系统有点混乱。大多数大型商店使用一种“拼凑式”方法。如果你用照片搜索,一个专门的图像查找器会寻找相似图片;如果你输入文字,一个文本查找器会寻找匹配标题。如果你说“找一件像这张照片里的红裙子,但要长袖的”,系统必须尴尬地将你的请求拆分成碎片,发送给不同的工人,然后尝试将结果重新粘合在一起。这既缓慢又复杂,而且经常会偏离重点,因为这些“工人”并不理解图片和文字是如何协同工作的。
或者,也有“游客型”导游(通用 AI 模型)。它们非常擅长理解世界,但并不了解购物中心的具体规则。它们可能意识不到“丝绸”和“缎面”是不同的,或者不知道买手机壳的用户很可能会寻找屏幕保护贴。它们也无法直接指向目录中某个特定的产品;它们通常需要一个单独的工具来完成这项工作,这破坏了流程的连贯性。
解决方案:一种新的产品语言
为了解决这个问题,团队创建了 Pailitao-MMSearch,这是一个原生的电商搜索基础模型。可以把它想象成训练一名能够流利使用购物中心语言的新员工。
1. 混合 ID (HybSID):既是“邮编”也是“肖像”
向计算机描述产品的最大挑战是什么?想象你有一个拥有数十亿本书的图书馆。如果你只给它们一个“邮编”(例如“小说 - 推理”),你会得到一大堆书,但无法找到你想要的那一本。如果你只给它们一个“肖像”(详细的描述),则很难高效地组织它们。
团队发明了 HybSID(混合语义 ID)。这就像是同时给每个产品两个 ID:
- 邮编 (离散代码): 一个简短、简单的代码,将产品归入广泛的类别(例如“夏季连衣裙”)。这有助于计算机快速缩小搜索范围。
- 肖像 (连续嵌入): 一个详细、高分辨率的产品“肖像”,捕捉如精确的蓝色色调、织物纹理或特定品牌 Logo 等微小细节。
通过结合这两者,模型可以快速找到正确的“产品社区”,然后挑选出完全符合用户特定、模糊描述的那个精准单品。
2. 两阶段训练:学习购物规律,同时保留大脑
教一个通用 AI 成为购物专家是有风险的。如果你只是喂给它数百万个产品描述,它可能会忘记如何进行正常的语言交流或逻辑推理。这被称为“灾难性遗忘”。
团队使用了一种巧妙的两步训练过程:
- 第一阶段(实习期): 他们教会了模型关于购物的一切:产品细节、人们如何浏览以及哪些物品可以搭配使用。他们还加入了一些正常的对话数据,以防止模型变得过于痴迷于产品本身。
- 第二阶段(导师制): 他们注意到模型在通用推理方面变得有些“生锈”了。因此,他们使用原始的、聪明的模型版本作为“导师”。他们让新模型在导师的监督下练习通用任务,通过导师的温和纠正,确保它不会失去思考和遵循复杂指令的能力。这确保了最终的模型既是购物专家,又是聪明的对话者。
3. 推理引擎:先思考,后表达
购物并不总是简单的。有时你会说:“我想要一件像这样的一件裙子,但要是海军蓝色的,并且要适合参加婚礼。”这是一个复杂的请求。
团队教会了模型使用思维链 (Chain-of-Thought) 来处理难题。模型不再仅仅是猜测答案,而是学会了将问题分解:
- 分析照片: “这是一件碎花裙。”
- 阅读请求: “将颜色改为海军蓝,将风格改为正式。”
- 寻找匹配: “好的,我需要一件海军蓝、正式款的碎花裙。”
对于简单问题,它会跳过思考过程,直接给出答案以节省时间。
结果:现实世界的成功
团队不仅是在实验室里测试,他们还将该系统部署在了服务于数千万日活用户的 淘宝 Pailitao 平台上。他们进行了一次大规模测试(A/B 测试),其中一部分用户使用旧的搜索系统,另一部分用户则使用新的 Pailitao-MMSearch。
结果令人印象深刻。新系统实现了:
- 总成交额 (GMV) 增长了 13.61%。
- 交易量增加了 8.21%。
这表明,当计算机真正理解你的意思——结合你的照片、你的文字以及你的购物习惯时——它能帮助你找到真正想要的东西,从而让你产生更多的购买行为。
未来展望
作者承认该系统目前尚不完美。如果用户上传了一张角度奇特的模糊照片,或者写了一句充满错别字的句子,模型仍然可能会感到困惑。他们计划让模型在处理这些混乱的现实情况时具备更强的推理能力。他们还看到了一个未来,即这种智能搜索模型将成为自主购物智能体的“大脑”,能够执行多步骤任务,比如寻找一套穿搭、检查天气,并一站式完成下单。
简而言之,Pailitao-MMSearch 是迈向一种全新购物体验的一步,在这种体验中,计算机不仅仅是匹配关键词,而是能够真正理解你的意图、你的风格以及你的需求,并在一次流畅的对话中完成这一切。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。