AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
AgenticRecTune 是一个由大语言模型驱动的多智能体框架,它通过协调专用智能体来提议、筛选和验证配置,同时持续演进技能库以捕捉领域特定见解,从而实现复杂多阶段推荐系统端到端优化的自动化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个巨大的高速火车站,每秒都有数百万名乘客(用户)抵达,寻找能带他们前往目的地的完美列车(内容)。这正是像Google Discover这样的大型推荐系统的工作方式。
传统上,管理这座车站就像试图指挥一支复杂的管弦乐队,而指挥家一次只能调整一种乐器。如果小提琴(排序模型)的声音变大了,指挥家就必须手动调整鼓(预排序模型)和铜管(重排序模型),以保持音乐的平衡。这个过程缓慢、昂贵,并且需要人类专家在每次音乐变化时猜测正确的设置。
这篇论文介绍了AgenticRecTune,一种新的"AI 乐队经理”,它自动化了整个流程。不再是人类进行猜测,而是一支由五个专门 AI 智能体组成的团队协同工作,全天候为整个系统寻找最佳设置。
以下是该团队如何运作的简单类比:
1. 五人智能体团队
将系统想象成一家试图推出完美产品的初创公司。它需要五个特定的角色:
- 执行者(创意生成器): 这个智能体是富有创造力的头脑风暴者。它审视当前状况并提出:“如果我们把‘多样性’的音量调高 5% 会怎样?”或者“如果我们稍微降低‘点击’的权重会怎样?”它提出许多不同的设置(配置)供尝试。
- 批评者(质量控制经理): 在执行者的疯狂想法上线之前,批评者会介入。它像一位严格的编辑或安全检查员。它检查这些想法:“这安全吗?符合规则吗?我们以前尝试过并失败过吗?”它过滤掉糟糕的想法,只让最好的想法继续推进。
- 在线智能体(实地测试员): 一旦批评者批准了一个想法,该智能体就将其带入现实世界。它建立一个实时实验(A/B 测试),让一小部分真实用户看到新设置。这就像在把新食谱端给整个餐厅之前,先让几位顾客试吃。
- 洞察智能体(数据侦探): 实验结束后,该智能体查看结果。它不仅仅看数字,而是寻找模式。它会问:“为什么用户喜欢新设置?是因为多样性,还是因为速度?”它将原始数据转化为经验教训。
- 技能智能体(图书管理员): 该智能体将侦探得出的教训写入一本“技能书”。它更新团队的知识,以便下次不再犯同样的错误。这就像厨师将新的秘密配料写入食谱书,让全团队都能从中学习。
2. “自我进化”的技能书
该系统最酷的部分是Skillhub。过去,如果一位人类工程师学到了新技巧,他必须编写手册,并希望每个人都能阅读。
在 AgenticRecTune 中,洞察智能体和技能智能体协同工作,自动更新这本技能书。
- 如果系统尝试了一个设置却失败了,技能书就会学到:“不要再那样做了。”
- 如果某个设置奏效了,技能书就会学到:“这是一个好技巧;让我们尝试它的变体。”
- 随着时间的推移,系统会自行变得更聪明,构建起一个无需人类编写指令的“领域专业知识”库。
3. 为什么这很重要
论文解释说,推荐系统极其复杂。它们有三个主要阶段:
- 预排序: 快速过滤数百万个项目,找出几千个。
- 排序: 仔细评分这几千个项目,找出最好的。
- 重排序: 进行最终调整,确保列表看起来多样化并符合业务规则。
改变其中一部分往往会破坏其他部分。找到完美的平衡点(“甜蜜点”)就像骑着独轮车玩杂耍。人类在这方面很慢,因为他们一次只能测试一个想法。AgenticRecTune 自动运行数千次这样的“杂耍”实验,在现实世界中测试不同的设置组合,以找出最佳方案。
4. 结果
团队在Google Discover(一款供数百万人使用的真实在线产品)上测试了该系统。他们发现:
- AI 团队能够找到比人类工程师手动寻找更好的设置。
- 它成功平衡了相互竞争的目标,例如在增加用户点击量(参与度)的同时,向他们展示更广泛的主题(多样性)。
- “执行者 - 批评者”方法(拥有创意生成器和批评者)比仅由一个智能体猜测要有效得多。
- 系统从自身的实验中学习,每一轮测试都变得更好。
简而言之: AgenticRecTune 是一个自我改进的 AI 智能体团队,就像一个超级高效、不知疲倦的工程团队。它不断进行实验,从错误中学习,并更新自己的规则书,以保持推荐系统处于最佳运行状态,而无需人类每天去调节旋钮。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。