← 最新论文
🤖 machine learning

Representation Curriculum: Stagewise Training for Robust Ranking and Allocation

该论文提出了“表示课程”(Representation Curriculum),这是一种阶段式训练方法,它在引入依赖于曝光的信念信号之前,优先考虑基于内容的价值信号,以缓解捷径学习,从而在改善排序鲁棒性和冷启动泛化能力的同时,管理其与头部性能之间的权衡。

原作者: Ehsan Ebrahimzadeh, Sina Baharlouei, Abraham Bagherjeiran

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ehsan Ebrahimzadeh, Sina Baharlouei, Abraham Bagherjeiran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一个规模巨大的在线市场,就像一个巨大的数字跳蚤市场。你的职责是决定先向购物者展示哪些商品。你希望向他们展示最好、最相关的商品,这样他们就能找到所需的东西并进行购买。

问题在于,你的“老师”(你学习的数据)是有偏见的。它只向你展示那些以前被展示过很多次的商品。

问题:“名声显赫的学生”陷阱

把你的排序系统想象成一个正在参加考试的学生。

  • “品质”线索(内容): 这些是关于商品的实际事实。这是一只红色的鞋子吗?它是皮革材质吗?价格合理吗?无论商品是新的还是旧的,这些线索都存在。
  • “流行度”线索(历史): 这些是关于过去有多少人点击或购买该商品的统计数据。

在正常的课堂上,如果一个学生看到关于“名牌红鞋”(被点击了一百万次的鞋子)的问题,他会立刻答对,因为他已经见过这双鞋一百万次了。他不需要去看鞋子的实际描述;他只需要依赖于“大家都知道这双鞋”这个事实。

陷阱: 由于“流行度”线索太容易利用了,学生(AI)就会变得懒惰。它停止学习如何判断鞋子的实际质量。它只是记住了:“如果点击量高,就展示它。”

后果:

  1. 新商品(冷启动): 当一只全新的、极好的鞋子到来时,AI 会忽略它,因为它没有“点击历史”。这只新鞋永远不会被看到。
  2. 循环: AI 不断展示那些旧的、名声显赫的鞋子,因此它们获得了更多的点击,使得 AI 更加确信它们是最好的。新鞋因此被饿死了。

解决方案:“表征课程”(Representation Curriculum, RC)

作者提出了一种教导 AI 的新方法,叫做表征课程(Representation Curriculum)。你可以把它想象成一位严格的老师,通过改变教学计划来强迫学生学会正确的方法。

他们将训练分为两个截然不同的阶段:

第一阶段:“盲测”(仅限内容)

在训练的第一部分,老师隐藏了流行度线索

  • AI 只被允许观察商品的描述、价格和属性(即“品质”线索)。
  • 它必须学会仅根据鞋子本身是什么来判断它。
  • 目标: AI 构建了一个强大的“内容肌肉”。它学会了即使没有点击量,高质量的描述也是好的。

第二阶段:“锚定测试”(内容 + 历史)

现在,老师揭示了流行度线索。AI 可以再次看到点击历史。

  • 转折点: 老师给 AI 设置了一个“安全锚”。这个锚强制要求 AI 保持其“内容肌肉”与第一阶段时一样强壮。
  • AI 可以使用流行度线索来获得更高的分数,但它不允许忘记或削弱其判断内容的能力。
  • 结果: AI 学会了将流行度作为一个有用的提示,但它不会让流行度凌驾于商品的实际质量之上。

为什么这有效(类比)

想象你在招聘一名厨师。

  • 旧方法: 你只雇佣那些获得过“最佳厨师”奖项的厨师(流行度)。你从不检查他们是否具备从零开始烹饪美食的能力。最终,你只会雇佣获奖的厨师,你也无法发现任何新人才。
  • RC 方法:
    1. 首先,你仅根据他们的食谱和烹饪技巧(内容)来雇佣厨师,忽略他们的奖项。你训练他们成为优秀的厨师。
    2. 然后,你告诉他们:“好吧,现在你可以利用你的奖项来更快地被雇佣,但你必须保持你的烹饪技能与没有奖项时一样出色。”

结果

论文通过两种方式测试了这种方法:

  1. 在公开数据集上: 他们展示了这种方法能显著提升 AI 对新商品(冷启动)的排序能力,且不会损害其在热门商品上的表现。
  2. 在现实生活中(eBay): 他们在 eBay 的搜索系统中进行了一项真实的实验。
    • 结果: 新系统向购物者展示了更多的产品。
    • 销售额: 新商品的销售速度更快。
    • 整体健康度: 整个网站的总销售额和点击量保持不变(中性),这意味着他们并没有为了帮助新商品而亏损,而是让系统变得更公平、更稳健。

总结

论文认为,如果你让 AI 过早地从“名声显赫”的数据中学习,它就会变得懒惰,从而忽略新的、潜在优秀的商品。通过强迫 AI 先学习商品的“本质”(第一阶段),然后小心地将“名声”重新加入其中(第二阶段),且不让名声占据主导地位,你就能得到一个对新商品更公平、更稳健的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →