← 最新论文
🤖 machine learning

Don't Contrast the Impossible: Region-Constrained Batching for Contrastive User Modeling on a Local Community Platform

本文提出了一种区域约束批采样(Region-Constrained Batch Sampling, RCBS)方法,这是一种针对本地社区平台的创新批处理方法,通过将地理上不可能的负样本替换为可行的负样本来改进对比用户建模,从而提升生产环境中的推荐和广告性能。

原作者: Seungho Han, Byeongchang Kim, Jin Yu

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Seungho Han, Byeongchang Kim, Jin Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何理解人们的喜好。在计算机科学领域,这被称为“推荐系统”,而机器人的大脑是使用一种叫做“对比学习”的技术构建的。把这想象成一场“找不同”的游戏。为了教会机器人用户喜欢什么,你给它看一张用户点击过的图片(一个“正样本”),然后给它看一堆用户没有点击的其他图片(“负样本”)。机器人通过意识到:“啊,用户喜欢这个,但不喜欢那些其他的”来学习。

为了让这个游戏顺利进行,你展示给机器人的“负面”图片必须是用户本可以看见但仅仅是忽略了的东西。如果你向一个住在沙漠中心且从未见过企鹅的用户展示一张企鹅的照片,机器人学不到任何有用的东西。用户忽略企鹅并不是因为不喜欢它;而是因为他们根本不可能看到它。这篇论文解决了一个特定的问题:即“游戏板”有着严格的规则,规定了谁能看到什么,而机器人因为展示了一些不可能出现的东西而产生了困惑。


问题所在:用“不可能的选择”来教机器人

在像 Karrot(韩国一个流行的同城社区应用)这样的本地社区应用上,游戏的规则与亚马逊这样的全球性商店非常不同。在 Karrot 上,你只能看到离你近的物品。如果你住在首尔,即使 부산(釜山)有一辆再酷的自行车在售,你也看不到它。该应用的设计使得距离就像一堵墙;墙另一边的物品对你来说是完全不可见的。

研究人员发现,训练机器人的标准方式犯了一个大错。机器人是在使用“小批量”(mini-batches)进行训练,这些小批量是将用户和物品随机混合在一起的小组。由于这种混合是随机的,机器人经常会被展示一些对于特定用户来说在物理上是不可能看到的物品。例如,它可能会向一个社区的用户展示来自 50 公里外另一个社区的物品。

论文将这些称为“不可能的负样本”。当机器人看到一个用户忽略了一个对他而言不可能看到的物品时,它会想:“好吧,这个用户肯定讨厌这个物品!”但这不对。用户并不是讨厌它,而是根本看不见它。这就像是一个老师在责备学生没有回答一个用学生完全不懂的语言编写的问题。论文指出,用这些“不可能”的选择来填充训练游戏,会稀释机器人的学习效果,使其难以准确预测人们真正想要什么。

解决方案:“同社区”规则

为了解决这个问题,作者 Seungho Han、Byeongchang Kim 和 Jin Yu 提出了一种新的组织训练游戏的方法,称为区域约束批量采样(Region-Constrained Batch Sampling, RCBS)

RCBS 不再是将所有人扔进同一个大桶里,而是扮演着一个严格的“邻里监督员”的角色。当它创建用于训练机器人的用户组时,它只挑选居住在同一区域(或非常接近的区域)的用户。因为该组中的每个人都住在附近,所以该组中展示的每一个物品,理论上都是该组中任何人都能看到的。

这个简单的改变产生了强大的效果。现在,当机器人看到一个用户忽略某个物品时,它确切地知道该用户能够看到它。如果他们仍然没有点击,那就是一个真实的信号,表明他们对此不感兴趣。这些被称为“可行的负样本”。论文指出,比起那些容易的“不可能”选择,这些“可行”的选择实际上对机器人的学习更有难度,也更有信息量。这就像是将机器人的训练从“猜测锁在箱子里的东西”升级到了“猜测就在你面前的箱子里的东西”。

他们的发现:一个更好的机器人

团队通过两种方式测试了这个想法:首先是通过模拟运行(类似于练习赛),其次是在真实的 App 上使用真实用户进行测试(实时 A/B 测试)。

在模拟中,他们测量了训练组中包含了多少“不可能”的选择。使用旧的随机方法,竟然有高达 98% 的负面选择对于用户来说是不可见的。使用他们新的 RCBS 方法,他们成功将这个数字降到了 30%

结果非常明确。使用这种“邻里规则”训练出的机器人能更好地理解用户。

  • 线下测试: 与旧机器人相比,新机器人在首页信息流搜索方面的能力提升了约 7.56%,在广告排名方面的能力提升了 4.61%
  • 线上测试: 当他们将新机器人投入到实际应用中时,结果更加令人兴奋。首页信息流的点击量增加了 10.0%,信息流的曝光量(展示次数)增加了 5.12%。甚至广告的表现也更好,点击率提升了 7.46%

总结

论文得出结论,对于本地社区平台,你不能只是随机地匹配用户和物品。你必须尊重地理位置。通过确保机器人只从用户实际能看到的东西中学习,机器人学习得更快、更聪明。作者们已经将这种新方法部署到了 Karrot,它现在正帮助数百万用户在自己的社区内找到他们真正想要的东西。他们认为,虽然这迈出了重要的一步,但未来可能还有更多微调这些“邻里”规则的方法,但就目前而言,“不要对比不可能的存在”这一简单的修复方案已被证明是成功的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →