Reward-Free Evolving Agents via Pairwise Validator
本文提出了一种具有成本效益的自我进化智能体框架,该框架通过使用一个冻结的基于大语言模型的成对验证器来取代昂贵的标量奖励信号以引导智能体改进,在无需标注数据或额外训练的情况下,在多种引擎和基质上实现了具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不再仅仅是听从指令,而是真正学会编写自身指令的世界。这就是 AI Agent(人工智能智能体) 的领域——这些聪明的程序通过将复杂谜题分解为步骤、使用工具并进行逻辑思考来解决问题。通常,为了让这些智能体变得更好,人类必须扮演严厉的教练角色。每当智能体尝试一种新的思考方式时,教练都必须用特定的分数对其进行评分,就像老师给考试打分一样。但问题在于:创造那些完美的测试和评分标准极其困难、昂贵,且需要深厚的专业知识。这就像试图通过写一本 100 页的手册来教机器人如何切洋葱,结果却发现每种蔬菜都需要一本新的手册。
自我进化智能体(Self-Evolving Agents) 的概念应运而生。与其等待人类教练为每一次尝试打分,这些智能体会在一个循环中尝试自我改进:它们做出微小的改变,进行测试,如果看起来变好了,就保留这个改变。科学家们一直在问的一个大问题是:我们能否完全跳过昂贵的人类评分环节? 如果智能体可以仅仅通过观察自己的“旧自我”和“新自我”,并在不需要完美分数的情况下决定哪一个更好,会发生什么?这篇论文深入探讨了这个问题,提出了一种巧妙的捷径,用简单的快速比较取代了沉重且昂贵的评分系统。
问题所在:昂贵的“计分卡”
把构建一个超级聪明的 AI 智能体想象成训练一只做动作的狗。在旧的方法中,每当狗尝试一个新动作时,人类训练员都必须介入,仔细观察并给出一个精确的分数:“那是 7.5 分(满分 10 分)。”为了获得可靠的分数,训练员需要一个庞大的完美范例库来进行对比。对于 AI 而言,这个“计分卡”被称为 标量奖励(scalar reward)。它是一个单一的数字,告诉智能体表现得如何。
问题是,制作这个计分卡是一场噩梦。它需要聘请专家、标注数以千计的样本,并且耗资巨大。有时,任务非常奇特或复杂,以至于人类甚至无法就什么是“好”的分数达成共识。这就像是在给一幅关于梦境的画作评分:没有标准答案,因此给出数字是不可能的。
解决方案:“谁更强?”的游戏
这篇论文的作者刘明浩及其团队提出了一个简单的问题:如果我们不再问“这个有多好?”,而是开始问“哪一个更好呢?”会怎样?
他们没有让(人类或复杂的计算机)试图为一个单独的尝试分配一个困难的数字,而是引入了一个 成对验证器(Pairwise Validator)。想象两个在拳击场上的选手:“父代”(智能体当前的当前版本)和“子代”(经过微调的新版本)。一个冻结的、预训练的大语言模型(LLM)充当裁判。它不需要知道确切的分数;它只需观察两者并说:“我认为子代更好,”或者“父代获胜。”
这对 AI 裁判来说要容易得多。这就像问朋友:“你更喜欢巧克力还是香草?”而不是要求他们按照 1 到 100 的精确刻度来评价两种口味。论文表明,这种“谁更强?”的游戏更加稳定,且不需要为裁判进行额外的训练。
两种全新的“剧本”
该团队通过两种不同的方式测试了这个想法,创建了两个新的“剧本”:
- 自适应聚焦(Adaptive Focus): 这是“聪明教练”法。智能体仍然使用一小组经由人类评分的示例来挑选下一轮作为“父代”的版本。然而,在决定是否接受一个新的改变时,它会跳过昂贵的计分卡,直接使用“谁更强?”的裁判。这是一种混合模式,它在日常决策上节省了成本,但在长期规划上保留了人类的安全网。
- 软 Elo(Soft Elo): 这是“纯锦标赛”法。在这里,智能体完全抛弃了人类计分卡。它利用裁判的“谁更强?”的裁决来运行一个评分系统(类似于国际象棋选手的等级分系统)。如果子代击败了父代,子代的评分就会提升。随着时间的推移,智能体完全基于这些面对面的对决进行进化,永远不需要人类来分配数字。
结果:它奏效了吗?
团队在各种挑战中测试了这些方法,从回答棘手的百科知识、解决数学问题到编写整理数据的代码。他们将这些新的“成对(Pairwise)”方法与旧有的“全奖励(Full-Reward)”方法(即昂贵的人类评分方式)进行了对比。
研究结果非常有力。在大多数测试中,使用“谁更强?”裁判的智能体表现得与使用昂贵人类计分卡的智能体一样好,甚至更好。
- 对于百科知识和指令: 在处理从文档集中回答问题的任务时,“软 Elo”方法实际上帮助智能体更好地实现了泛化,这意味着它不仅仅是死记硬背练习题,而是学会了实际的逻辑。
- 对于数学: 即使在难题上,新方法也能解决与旧方法同样数量的问题,证明了你不需要一个完美的分数也能找到优解。
- 对于代码: 在进化计算机程序时,成对门槛(pairwise gate)的表现与全奖励基准线一样出色,成功引导代码变得更加高效。
局限性与未来
论文谨慎地指出,这并不是应对所有情况的万灵药。该方法在智能体仍有提升空间时效果最好。如果智能体已经处于巅峰状态,或者裁判(LLM)对任务感到困惑,系统可能会陷入停滞。此外,如果“测试”规模太小(例如只有 15 道题的数学小测验),结果可能会显得有些波动,就像抛几次硬币并不能说明硬币是否公平一样。
然而,核心发现是一个游戏规则的改变者:你不需要一个完美且昂贵的计分卡来进化出一个聪明的 AI。 通过简单地让一个冻结的 AI 裁判比较两个版本并选出赢家,我们可以构建出与人类专家构建的智能体一样强大的自我进化智能体,而无需承担大规模的数据标注成本和精力。这是一种从“批改每一份试卷”到“只需选出最好的文章”的转变,事实证明,这足以教会机器如何思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。