Image Score: Learning and Evaluating Human Preferences for Mercari Search
本文提出了一种基于大语言模型、利用思维链提示生成图像质量标签的成本效益型方法,这些标签与 Mercari 电商平台上的用户行为高度相关,最终通过提升搜索相关性和可解释性实现了显著的销售增长。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,Mercari 就像一个庞大而繁忙的数字化跳蚤市场,数百万人在这里买卖从复古服装到二手电子产品的一切物品。在这个市场中,对卖家而言最重要的就是他们的“橱窗”——即他们为商品拍摄的照片。如果照片模糊、昏暗或杂乱,买家会直接滑过,即使价格再完美也无济于事。而如果照片明亮、清晰且看起来专业,买家就会停下并点击。
Mercari 的团队希望解决一个具体问题:我们如何在不雇佣大量人工评审的情况下,自动判断哪些照片是“好”的,哪些是“坏”的?
以下是他们如何实现这一点的故事,以简单的方式解释:
1. 问题:沉默的“买家”
在普通商店里,你可能会问朋友:“你喜欢这件衬衫吗?”但在在线市场中,买家不会说什么。他们要么点击,要么不点击。这被称为“隐性反馈”。
- 挑战: 如果买家点击了一件商品,是因为这件商品正是他们想要的(相关性),还是仅仅因为照片看起来很棒?
- 目标: 团队希望将“好照片”因素与“正确商品”因素区分开来。他们想知道:如果两件商品价格相同、类型相同,那么照片更好的那件是否会获得更多点击?
2. 解决方案:“AI 艺术评论家”
通常,要教会计算机什么是“好照片”,需要成千上万的人查看图片并打分。这既缓慢又昂贵。
相反,Mercari 团队使用了一种大型语言模型(LLM)——一种能够“看见”图像的超级智能 AI。将这种 AI 想象成一位虚拟艺术评论家。
- 过程: 他们选取了相似商品的组(例如五件相同类型牛仔裤的不同 listings),然后询问 AI:“看看这些照片。将它们相互比较。哪一张看起来最好?为什么?”
- 秘诀(思维链): 他们不仅要求 AI 打分,还要求 AI“大声思考”(Chain-of-Thought)。AI 必须解释为什么一张照片是好的:“光线明亮”、“颜色协调”、“背景干净”。这帮助 AI 给出了更准确的分数,与真实人类的判断更加一致。
3. 训练“智能排序器”
AI 评论家虽然很棒,但每次有人搜索时,用它来评估市场中的每一件商品都太慢且太昂贵了。这就像聘请一位著名艺术评论家去给图书馆里的每一张照片打分;那将耗费无穷无尽的时间。
因此,他们利用 AI 评论家的评分来训练一个轻量级、快速的计算机模型(即“智能排序器”)。
- 类比: 想象 AI 评论家是一位主厨,品尝一道菜并写下详细的评论。而“智能排序器”则是一位初级厨师,他观察主厨品尝许多菜肴,学习其中的规律,然后能够快速猜测新菜肴的质量,而无需每次都依赖主厨的帮助。
- 结果: 这个新模型学会了根据 AI 评论家给出的“评分”,预测哪些照片会获得点击。
4. 大测试:投入实际应用
他们在 Mercari 网站上进行了现实世界的测试。他们将用户分为两组:
- A 组(对照组): 按常规方式查看搜索结果。
- B 组(测试组): 查看搜索结果,其中“高质量照片”的商品被提升到了顶部,即使它们与搜索词的关联度略低。
结果:
- 在网页端: 测试组的购买量比对照组高出近 7%。“智能排序器”成功地将最漂亮的照片展示在买家面前,买家通过点击和购买做出了回应。
- 在移动端: 有趣的是,这在手机上的效果并不好。作者推测,这可能是因为手机屏幕较小,与在大型电脑显示器上浏览的用户相比,用户可能不太在意微小的视觉细节。
5. 隐患:“虚假”照片
论文还指出了一个有趣的副作用。由于 AI 喜欢漂亮的图片,一些卖家开始发布AI 生成的图像(计算机制作的 artwork),而不是商品的真实照片。这些虚假图片获得了完美的分数,并跃升至列表顶部,尽管它们并非真实商品。
- 教训: 系统需要一个“真相检测器”,以确保漂亮的图片实际上是真实商品,而不仅仅是数字艺术。
总结
Mercari 团队建立了一个系统,该系统利用智能 AI 对商品照片进行评分,训练一个更快的模型来模仿这种评分,并利用这些评分优先展示外观最佳的商品。结果如何?在网站上,人们购买了更多商品,因为商品看起来更好。这有点像重新布置杂货店,让最新鲜、色彩最鲜艳的蔬菜始终摆放在视线水平——自然而然地,人们会购买更多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。