← 最新论文
🤖 machine learning

Self-Balancing Gradient Allocation for Heterogeneity-Aware Feature Generation in Click-Through Rate Prediction

本文提出了 HeteGenCTR,这是一种新颖的点击率预测框架,通过引入自平衡梯度分配机制和难度引导注意力,解决了异构特征字段间的生成难度不平衡问题,从而相较于最先进基线显著提升了模型性能和冷启动处理能力。

原作者: Moyu Zhang, Yun Chen, Yujun Jin, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Moyu Zhang, Yun Chen, Yujun Jin, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一支学生团队参加一场涵盖多门学科的巨型考试。考试内容包罗万象,从基础算术到高级量子物理,从记忆简单词汇到分析复杂的历史序列。

在旧有的做法中(即论文中描述的“均匀生成”方法),老师对待每一门学科都完全一样。他们为每个学生在每道题目上投入相同的时间和精力。

问题所在:“简单”学科占据主导
由于数学题目简单,学生们能迅速解答并获得满分。老师看到这些满分成绩,便继续将重心放在数学上,因为这样“有效”。与此同时,学生们在艰难的量子物理和历史题目上挣扎。由于老师忙于为数学的成功喝彩,这些高难度学科从未获得足够的练习。它们始终薄弱,尽管正是这些高难度学科决定了学生能否进入顶尖大学(或者在此案例中,决定计算机能否预测你想购买什么)。

论文将这种现象称为“生成难度不平衡”。简单特征(如简单类别)主导了训练过程,而艰难且重要的特征(如你独特的用户 ID 或复杂的浏览历史)则被忽视。

解决方案:HeteGenCTR
作者提出了一种名为HeteGenCTR的新系统。你可以将其想象为一位聪明的老师,他意识到并非所有学科都生而平等。这位老师不再给每个人分配相同的时间,而是为每门学科使用一种特殊的“难度计”。

以下是其工作原理,通过两个主要工具实现:

1. 自平衡评分系统(损失分配)

想象老师有一条特殊规则:“学生掌握某门学科越困难,该学科的分数权重就越高。”

  • 工作原理:系统自动衡量“重构”(预测)每个特征的难度。
    • 如果某个特征很简单(例如一个简单的“是/否”类别),系统会说:“好的,你已经掌握了”,并降低分配给它的分数权重。
    • 如果某个特征很难(例如在数百万人中独特的用户 ID),系统会说:“这很难!我们需要在此聚焦”,并增加其分数权重。
  • 结果:计算机停止在简单内容上浪费能量,而是将其“脑力”(梯度)倾注到那些对预测点击真正至关重要的、高价值的困难特征上。

2. 难度引导的注意力(“聚焦”机制)

现在,想象学生们正在小组合作。在旧系统中,擅长数学的学生会主导对话,大声喊出他们的答案,淹没了那些试图解决高难度物理问题的学生。

HeteGenCTR 增加了第二条规则:“让专家安静,倾听学习者。”

  • 工作原理:在计算机的“大脑”(神经网络)内部,有一个机制控制每个特征“倾听”其他特征的程度。
    • 如果某个特征已经是专家(容易学习),系统会告诉它“闭嘴”,并更被动地倾听。它不再让简单特征劫持小组讨论。
    • 如果某个特征正在挣扎(难以学习),系统会放大它的声音,使其能从小组其他成员那里获得更多关注,从而更快地学习。
  • 结果:困难特征获得了提升所需的信息,而不是被简单特征淹没。

为何这很重要

该论文在来自大型电商平台(如阿里巴巴)的真实世界数据上测试了此方法。他们发现:

  1. 更精准的预测:通过解决不平衡问题,系统在预测用户点击行为方面变得更为出色。
  2. 助力“冷启动”:最大的改进体现在新用户或稀有用户(历史数据极少的人群)身上。在旧系统中,这些用户是个噩梦,因为他们的数据过于稀疏且难以学习。HeteGenCTR 专门针对这些难以学习的模式,为新用户提供了更好的体验。
  3. 现实世界的成功:他们在实际网站上进行了在线测试(A/B 测试)。与之前的最佳模型相比,新系统使点击量增加了4.7%

核心结论

该论文认为,不能对所有数据特征一视同仁。有些容易,有些困难。如果平等对待它们,简单的特征就会占据主导,而那些困难的特征(通常也是最重要的)将无法学习。HeteGenCTR 是一个智能的、自我调整的系统,它自动将更多的关注和资源分配给数据中困难的部分,确保整个系统学得更好、更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →