ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents
该论文提出了 ARCO,一个在共享模型主干内共同演化用于每步准则生成的生成头和用于步骤级奖励的评分头的框架,从而在不需要步骤级标签或静态闭源判别器的情况下,实现动态信用分配并提升多步智能体的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人去解决一个复杂的谜题,比如一个多步骤的侦探故事。机器人必须寻找线索、串联逻辑,并最终给出答案。
在过去,教导这些机器人就像是在玩一场由一位非常严格的裁判主持的“热还是冷”游戏。
- 旧方法: 机器人尝试解决整个谜题。如果它得到了最终正确答案,裁判会给出一个“做得好!”(高分)。如果它错了,裁判会给出一个“做得不好!”(低分)。
- 问题所在: 机器人并不知道自己为什么失败了。是因为问错了问题?忽略了某个线索?还是过早地做出了猜测?裁判只是说“错了”,让机器人只能靠猜来寻找错误原因。这就像一个学生在期末考试中得到了一个红色的“不及格”,却没有任何老师针对具体数学步骤错误的评语。
ARCO 登场:一位“协同进化”的教练
这篇论文介绍了 ARCO(自适应评分准则协同进化),一种训练这些 AI 智能体的新方法。把 ARCO 想象成不仅仅是一个单一的裁判,而是一位在观察学生工作的过程中,能够自行编写评分准则的聪明教练。
以下是它的工作原理,使用简单的类比:
1. “同等规模”的教练与学生
通常,我们会使用一个超级聪明、昂贵的“黑盒”评委(比如一个巨大的、闭源的 AI)来给机器人打分。但那个评委是静态的,它不会学习。
ARCO 使用的是一个与学生机器人的规模和“脑力”相当的教练(评分模型)。他们是合作伙伴。随着学生的进步,教练也变得更擅长评分。他们共同成长。
2. 编写清单(评分准则)
教练不仅仅是给出一个分数,而是为机器人的每一步动作编写一份清单。
- 第 1 步: 机器人搜索“谁是谢尔盖·托卡列夫(Sergei Tokarev)?”
- 教练的清单: “机器人是否搜索了正确的人?它是否避免了搜索无关人员?它是否找到了足够的证据?”
- 第 2 步: 机器人搜索“他的大学是什么时候成立的?”
- 教练的新清单: “机器人是否意识到它需要先知道大学名称?它是否停止了搜索无关事实?”
教练会为每一个动作编写一份新的清单,因为错误会随着机器人的学习而改变。在初期,机器人可能会搜错人。到了后期,它可能会搜对人,但方式不对。一个静态的清单无法捕捉所有的进化式错误,但 ARCO 的教练每次都会编写一份全新的清单。
3. “部分之和”规则
这是其中的魔力所在。教练并不是随机地为步骤评分。教练被教授了一条金科玉律:所有步骤的分数之和必须等于最终结果。
- 如果机器人完美解决了谜题(最终得分 = 100),教练必须找到一种方法,将高分给到正确的步骤,将低分给到错误的步骤,使它们的总和等于 100。
- 如果机器人失败了(最终得分 = 0),教练必须找出哪些具体的步骤拖累了分数。
这迫使教练去学习究竟是哪里出了错,即使没有人告诉他们“第 3 步很糟糕”。教练通过学习,将最终结果拆解成一个个微小且公平的部分。
4. 协同进化的舞蹈
最独特的部分是,学生和教练是同时更新的。
- 学生尝试解决谜题。
- 教练观察、编写清单并给出分数。
- 学生从分数中学习并变得更聪明。
- 因为学生现在变得更聪明了,它会制造出新型的错误(它不再犯初级错误了)。
- 教练看到了这些新的错误,并更新其清单以捕捉它们。
这就像一场舞蹈,舞伴(教练)不断调整自己的舞步以匹配舞者(学生)。如果学生开始跳华丽的旋转,教练就会学会如何为旋转评分,而不只是基础步法。
为什么这更好?
- 没有黑盒: 它不依赖于一个神秘、不可改变的巨大 AI 来评分。它使用一个透明的、开源的模型,并用通俗易懂的语言解释其推理过程。
- 步步清晰: 它能明确告诉机器人哪一步是好的或坏的,而不是仅仅说“你整个任务失败了”。
- 适应性: 随着机器人变得越来越好,评分标准也会变得越来越精细,从而捕捉到固定清单会错过的微妙错误。
简而言之,ARCO 将训练过程从一个“猜猜我错在哪”的游戏,变成了一个清晰的、循序渐进的教程,在这个教程中,老师和学生共同学习,并在过程中不断完善游戏的规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。