← 最新论文
💻 computer science

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

AgenticRecTune 是一个由大语言模型驱动的多智能体框架,它通过协调专用智能体来提议、筛选和验证配置,同时持续演进技能库以捕捉领域特定见解,从而实现复杂多阶段推荐系统端到端优化的自动化。

原作者: Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大的高速火车站,每秒都有数百万名乘客(用户)抵达,寻找能带他们前往目的地的完美列车(内容)。这正是像Google Discover这样的大型推荐系统的工作方式。

传统上,管理这座车站就像试图指挥一支复杂的管弦乐队,而指挥家一次只能调整一种乐器。如果小提琴(排序模型)的声音变大了,指挥家就必须手动调整鼓(预排序模型)和铜管(重排序模型),以保持音乐的平衡。这个过程缓慢、昂贵,并且需要人类专家在每次音乐变化时猜测正确的设置。

这篇论文介绍了AgenticRecTune,一种新的"AI 乐队经理”,它自动化了整个流程。不再是人类进行猜测,而是一支由五个专门 AI 智能体组成的团队协同工作,全天候为整个系统寻找最佳设置。

以下是该团队如何运作的简单类比:

1. 五人智能体团队

将系统想象成一家试图推出完美产品的初创公司。它需要五个特定的角色:

  • 执行者(创意生成器): 这个智能体是富有创造力的头脑风暴者。它审视当前状况并提出:“如果我们把‘多样性’的音量调高 5% 会怎样?”或者“如果我们稍微降低‘点击’的权重会怎样?”它提出许多不同的设置(配置)供尝试。
  • 批评者(质量控制经理): 在执行者的疯狂想法上线之前,批评者会介入。它像一位严格的编辑或安全检查员。它检查这些想法:“这安全吗?符合规则吗?我们以前尝试过并失败过吗?”它过滤掉糟糕的想法,只让最好的想法继续推进。
  • 在线智能体(实地测试员): 一旦批评者批准了一个想法,该智能体就将其带入现实世界。它建立一个实时实验(A/B 测试),让一小部分真实用户看到新设置。这就像在把新食谱端给整个餐厅之前,先让几位顾客试吃。
  • 洞察智能体(数据侦探): 实验结束后,该智能体查看结果。它不仅仅看数字,而是寻找模式。它会问:“为什么用户喜欢新设置?是因为多样性,还是因为速度?”它将原始数据转化为经验教训。
  • 技能智能体(图书管理员): 该智能体将侦探得出的教训写入一本“技能书”。它更新团队的知识,以便下次不再犯同样的错误。这就像厨师将新的秘密配料写入食谱书,让全团队都能从中学习。

2. “自我进化”的技能书

该系统最酷的部分是Skillhub。过去,如果一位人类工程师学到了新技巧,他必须编写手册,并希望每个人都能阅读。

在 AgenticRecTune 中,洞察智能体技能智能体协同工作,自动更新这本技能书。

  • 如果系统尝试了一个设置却失败了,技能书就会学到:“不要再那样做了。”
  • 如果某个设置奏效了,技能书就会学到:“这是一个好技巧;让我们尝试它的变体。”
  • 随着时间的推移,系统会自行变得更聪明,构建起一个无需人类编写指令的“领域专业知识”库。

3. 为什么这很重要

论文解释说,推荐系统极其复杂。它们有三个主要阶段:

  1. 预排序: 快速过滤数百万个项目,找出几千个。
  2. 排序: 仔细评分这几千个项目,找出最好的。
  3. 重排序: 进行最终调整,确保列表看起来多样化并符合业务规则。

改变其中一部分往往会破坏其他部分。找到完美的平衡点(“甜蜜点”)就像骑着独轮车玩杂耍。人类在这方面很慢,因为他们一次只能测试一个想法。AgenticRecTune 自动运行数千次这样的“杂耍”实验,在现实世界中测试不同的设置组合,以找出最佳方案。

4. 结果

团队在Google Discover(一款供数百万人使用的真实在线产品)上测试了该系统。他们发现:

  • AI 团队能够找到比人类工程师手动寻找更好的设置。
  • 它成功平衡了相互竞争的目标,例如在增加用户点击量(参与度)的同时,向他们展示更广泛的主题(多样性)。
  • “执行者 - 批评者”方法(拥有创意生成器和批评者)比仅由一个智能体猜测要有效得多。
  • 系统从自身的实验中学习,每一轮测试都变得更好。

简而言之: AgenticRecTune 是一个自我改进的 AI 智能体团队,就像一个超级高效、不知疲倦的工程团队。它不断进行实验,从错误中学习,并更新自己的规则书,以保持推荐系统处于最佳运行状态,而无需人类每天去调节旋钮。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →