← 最新论文
💬 NLP

Self-supervised User Profile Generation for Personalization

该论文介绍了 BUMP,这是一个自监督框架,通过使用带有 GRPO 的双向批次内排序目标来训练大语言模型以生成用于个性化的用户画像,从而消除了对昂贵的下游任务标签的需求,同时实现了与监督方法相当甚至更优的性能。

原作者: Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Clark Mingxuan Ju, Yuwei Qiu, Tong Zhao, Neil Shah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有点健忘的助手(AI)。你希望这个助手能如此了解你,以至于它能按照你喜欢的方式为你写邮件、推荐电影或回答问题。

问题在于,多年来你与这个助手有着数千次互动。如果你每次提问都试图把你的整个历史记录都喂给助手,它会感到不堪重负、反应迟钝且陷入混乱。这就像为了找一本特定的书而试图读完一整座图书馆。

解决方案:“用户身份证”
与其把整座图书馆都倒给助手,该论文提议为每个用户创建一个简短、自然的语言“身份证”或画像(Profile)。这个画像总结了你是谁以及你喜欢什么。助手在回答你的问题之前会先阅读这张简短的卡片,从而让你感觉到它非常了解你。

旧方法 vs. 新方法 (BUMP)

  • 旧方法: 为了教 AI 如何编写这些身份证,研究人员通常需要一位老师来为每一张卡片评分。“这张卡片很适合推荐电影,”老师会说,“那一张则不适合写邮件。”这种方式既昂贵又缓慢,并且需要人类为每一个新任务标注数据。
  • 新方法 (BUMP): 作者创建了一个名为 BUMP(通过画像进行的双向用户建模)的系统。它教会 AI 编写这些画像,而无需任何人类老师或标签。它使用了一种“自我检查”的方法。

BUMP 是如何工作的:“双面镜”测试
想象一个装满了人(一批用户)的房间。AI 尝试为 A 写一份画像。为了看这份画像是否合格,它会使用一个小型、固定的“裁判” AI 进行两项测试:

  1. “猜猜是谁”测试(正向过程):
    AI 向“裁判”展示 A 的新画像,以及 A 和其他几个人的近期活动记录。

    • 问题: “基于这个画像,这些活动中哪些属于 A?”
    • 目标: 如果画像写得好,“裁判”应该能轻松地从其他人的活动中挑出 A 的活动。
  2. “我是谁?”测试(反向过程):
    AI 向“裁判”展示 A 的一项近期活动,以及 A 和其他人的画像。

    • 问题: “基于这项活动,哪个画像与之最匹配?”
    • 目标: 如果画像写得好,“裁判”应该能立即选出 A 的画像,而不是其他人的。

如果 AI 能通过这两项测试,它就知道自己已经写出了一份真正捕捉到了该特定个体特征的画像。它通过不断尝试通过这些测试来学习,利用“裁判”来给出评分,而从未需要人类来说“做得好”。

“困难模式”升级 (BUMP+)
有时,“裁判”觉得分辨不同的人太容易了(例如,比较一个厨师的画像和一个摇滚明星的画像是非常明显的)。为了让 AI 更聪明,BUMP+ 加入了“困难模式”。它专门寻找与用户非常相似的人(比如两个厨师),并迫使 AI 写出一份能将他们区分开来的画像。这使得画像更加精准。

结果
论文在标准任务集(LaMP)上测试了该方法。他们发现:

  • 他们的自学系统 (BUMP+) 表现得与那些需要昂贵人工标注的系统一样好,甚至更好。
  • 他们运行在一个相对较小的开源模型上的系统,在个性化任务上击败了庞大且昂贵的闭源 AI (Gemini-3-Pro)。
  • 它通过将用户的长篇历史压缩成一段简短、有用的摘要,让 AI 感觉像是一个相识已久的老友。

简而言之
BUMP 是一种教 AI 编写完美的“用户传记”的方法,它不是通过让人类给它的工作打分,而是通过让 AI 在人群中玩一场“将画像与人匹配”的游戏。这是一种更聪明、更便宜、更具扩展性的方式,让 AI 变得更具个性化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →