← 最新论文
💬 NLP

Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation

本文提出了一种结合强化学习与知识蒸馏的框架,通过训练大语言模型从跨域用户信号中生成兴趣驱动的新闻搜索查询,并利用在线蒸馏技术将高性能策略迁移至轻量级模型,从而在大规模新闻推荐系统中显著提升了用户兴趣建模质量与推荐效果。

原作者: Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何更懂你”**的故事,特别是当你在不同的网络世界里留下足迹时,新闻平台如何真正理解你的兴趣,而不是仅仅盯着你点过什么。

我们可以把这篇论文的核心思想想象成**“一位超级侦探(大模型)在训练一位敏捷的助手(小模型)”**。

以下是用大白话和比喻为你拆解的整个过程:

1. 痛点:你留下的“脚印”太乱了

想象一下,你在网上冲浪,就像在森林里走路。

  • 你搜过“怎么做红烧肉”(搜索记录)。
  • 你点过一篇关于“火星移民”的文章(新闻点击)。
  • 你在某个论坛发过“周末去哪玩”的帖子(浏览历史)。

传统的推荐系统就像是一个只会数脚印的统计员。它只会说:“这个人点了 10 次科技新闻,所以给他推科技新闻。”但这有个大问题:

  • 太表面:它不知道你为什么点科技新闻(是因为喜欢,还是因为工作需要?)。
  • 太死板:它很难把你“搜索红烧肉”和“浏览美食文章”联系起来,发现你其实是个“吃货”。
  • 跨域难:它在不同平台(搜索、点击、浏览)之间很难打通,就像统计员把森林里的脚印、车辙和鸟鸣混在一起,却分不清哪些是“你”留下的。

2. 核心方案:让 AI 当“翻译官”和“侦探”

这篇论文提出了一种新方法,不再直接猜你爱看什么,而是让你“想”出你真正感兴趣的话题

第一步:大侦探(老师模型)出场

他们训练了一个超级大模型(Teacher LLM,比如 320 亿参数),就像一位经验丰富的老侦探。

  • 任务:老侦探把你所有的杂乱脚印(搜索、点击、浏览)放在一起看。
  • 推理:它不只是数数,而是思考。它会想:“哦,这个人搜了红烧肉,又看了美食文章,还搜了‘周末去哪’,看来他最近对‘家庭烹饪’和‘周末短途游’特别感兴趣。”
  • 输出:老侦探不会直接给你推文章,而是生成一份“搜索关键词清单”(比如:“家庭红烧肉做法”、“周末亲子游攻略”)。这份清单代表了你深层的、可复用的兴趣

第二步:如何教好侦探?(强化学习 + 多重奖励)

怎么确保老侦探生成的清单是高质量的呢?就像教学生做题,不能只给答案,要给多维度的评分

  1. 能不能搜到东西?(检索对齐):生成的关键词必须能在新闻库里搜到好文章。
  2. 覆盖全不全?(兴趣覆盖):不能只盯着一个点,要覆盖你所有的兴趣面。
  3. 够不够具体?(查询特异性):不能只写“新闻”,要写“最新科技动态”。
  4. 有没有重复?(列表多样性):清单里不能全是同一个意思的词。
  5. 格式对不对?(结构有效性):必须是个像样的列表。

老侦探通过不断尝试、自我反思(强化学习),在这些评分标准下变得越来越聪明。

第三步:培养小助手(蒸馏技术)

问题来了:老侦探虽然聪明,但太笨重了!它思考一次需要很久,成本很高,没法在几毫秒内给几百万用户同时服务。

于是,他们用了**“师徒制”(蒸馏)**:

  • 老师(大模型):在后台慢慢思考,生成完美的关键词清单。
  • 学生(小模型,比如 0.5B 参数):在旁边看着老师怎么做,学习老师的“思维过程”和“决策逻辑”。
  • 结果:学生模型虽然个头小、反应快,但它继承了老师 90% 以上的智慧。现在,它可以在瞬间生成高质量的关键词清单,直接用于在线推荐。

3. 两个有趣的发现:算力和规模的力量

论文里还做了两个有趣的实验,就像在测试“练功”的效果:

  1. 模型越大,越聪明(空间缩放):把老师模型从“小学生”(0.5B)升级到“博士”(32B),它理解用户的能力确实更强了,推荐更准。
  2. 多想几次,更精准(时间缩放):让模型在生成答案前,先“头脑风暴”出 32 个方案,然后挑最好的那个。结果发现,想得越多,答案越完美。

4. 实际效果:真的有用吗?

  • 离线测试:在历史数据上跑,新方法的推荐准确率(Recall, NDCG)比以前的老方法(如 GRU, SASRec 等)都要高。
  • 在线实战(A/B 测试):这是最关键的。他们把这个系统放到了真实的新闻 App 里运行了一周。
    • 结果:用户的**日活(DAU)点击率(CTR)**都提升了。
    • 惊喜:对于**“冷启动用户”**(那些刚注册、没怎么点过新闻的新用户),效果提升特别巨大(DAU 提升了 4.38%)。这说明,哪怕没有太多历史数据,只要通过跨平台的信号(搜索、浏览)去推理,也能很快猜出你喜欢什么。

总结

这篇论文的核心就是:
别只盯着用户“做了什么”(点击),要利用大模型的推理能力,去理解用户“想要什么”(深层兴趣)。

他们先让一个超级大脑学会如何从杂乱的信息中提炼出用户的兴趣清单,然后把这个智慧传授给一个轻量级的小模型,让它能在毫秒级时间内为亿级用户服务。这不仅让推荐更准,也让新用户能更快找到自己喜欢的内容。

这就好比,以前推荐系统像个只会数数的收银员,现在变成了一个懂你心思的私人管家,虽然管家思考需要时间,但通过“师徒传承”,我们拥有了一个既聪明又反应神速的管家团队。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →