← 最新论文
🤖 AI

Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents

本文介绍了一种利用 Google 的 Gemini 大语言模型智能体(LLM agents)通过双环工作流自主生成、验证并部署优化后的模型架构与奖励函数的自我演进推荐系统,并成功证明了在 YouTube 生产环境中,该系统与传统的工程开发相比,具有更优越的开发速度与性能表现。

原作者: Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你最喜欢的视频应用不仅仅是在猜测你接下来想看什么,而是实际上在学习如何让这种猜测变得越来越准,而且每天都在自我进化。这就是**强化学习(Reinforcement Learning)**的领域,它是人工智能的一个分支,其中的计算机程序就像一个充满好奇心的探险家。它尝试不同的动作(比如给你推送一个猫咪视频或是一个烹饪教程),观察结果(你是看了它?还是喜欢它?),并根据好的选择获得“奖励”。其目标是随着时间的推移实现奖励的最大化。但棘手之处在于:弄清楚究竟该如何给予这个“奖励”是非常困难的。这就像是在教一只狗去衔取东西,但你不会说狗语,而且狗要过好几周才会告诉你它是否开心。在传统情况下,人类必须花费数年时间来微调规则,猜测狗(或用户)真正想要的是什么,并手动重写代码。这篇论文提出了一个大胆的问题:我们能否构建一个系统,让它能够自主进行这种微调、实验和重写,而不需要人类在每一步都手把手地引导?

谷歌的研究人员提出了一个被称为**自进化推荐系统(Self-Evolving Recommendation System)**的解决方案。把它想象成一个数字工厂,那里的机器不仅能制造产品,还能在工厂运行的同时重新设计工厂布局、发明新工具并改写说明书。这个系统的核心是 LLM Agent(大语言模型智能体)——由大语言模型驱动的专门化计算机程序(这类 AI 能够写故事或与你聊天)。这些智能体充当了一支超级聪明、不知疲倦的机器学习工程师团队。它们不仅仅是微调一些数字;它们会阅读代码,针对系统运作方式提出天马行空的构想,编写测试这些构想的代码,然后检查结果。

该系统的运作类似于一场节奏截然不同的两人接力赛。第一位选手是 Offline Agent(离线智能体),即“快循环”。这个智能体是一个过度活跃的思想机器。它每五分钟就会“醒来”一次,观察海量数据,并生成数百个新的假设。它就像一位厨师在品尝汤品时,立刻想到:“如果加一撮肉桂会怎样?”或者“如果把菜刀换成搅拌机会怎样?”它利用“代理指标”(即快速、易于衡量的信号,用以暗示一个想法是否可行)来快速测试这些想法。如果测试碗里的汤味道不对,智能体就会转向下一个想法。

第二位选手是 Online Agent(在线智能体),即“慢循环”。它是一位谨慎的战略家。它从“快循环”中挑选出最好的想法,并在真实世界中、在真实用户身上进行测试。这是“北极星”测试。新配方是否真的让人们更快乐了,或者让他们观看的时间更长了?这需要时间——几天甚至几周——因为人类行为的变化是缓慢的。在线智能体决定哪些想法值得保留,哪些应该被丢弃,从而确保只有最有希望的改变才能进入最终的菜单。

论文发现,这个自主化的团队表现得异常出色。当他们让这些 AI 智能体在 YouTube 的推荐系统中自由发挥时,这些智能体不仅仅是在微调设置;它们还发现了全新的软件结构方式。例如,智能体发现将模型的“引擎”从一种数学类型切换到另一种类型(从 Adagrad 切换到 RMSprop)可以让系统学习得更快。它们甚至发明了一种新的“门控路径(gated path)”架构,这是一种让信息在系统中流动的巧妙方式,而人类此前从未尝试过。最令人印象深刻的是,它们重新设计了“奖励”系统本身。智能体不再仅仅统计点击量,而是学会了如何结合复杂的信号——比如用户是否分享了视频,或者是否长时间观看——从而创造出一个更聪明的“幸福感”定义。

结果是显著且可衡量的。在测试中,AI 驱动的变更改善了 YouTube 用户的关键指标,其表现优于许多人类工程师在同一时期所做的变更。该系统运行实验的速度是人类无法企及的,每周可以测试数百个想法,而人类只能测试寥寥数个。虽然论文指出,AI 仍然需要人类来设定宏观规则并检查最终结果,但它暗示,未来构建这些系统的方式可能不再像是一群工程师在深夜苦修代码,而更像是一位园丁在照料一株会自动修剪、自动播种的植物,使其每天都长得更好。作者证实了这种方法在现实世界中是行之有效的,证明了 AI 智能体确实可以扮演专家工程师的角色,发现那些既是结构性又是语义性的改进,而不仅仅是数值上的微调。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →