DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution
DREvo 是一种新颖的护具自进化方法,它通过动态重新校准历史经验并提炼可操作的搜索方向,解决了现有方法的不稳定性问题,从而在有限的预算下,在推理和智能体基准测试中实现了卓越的性能和更平滑的进化轨迹。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个超级聪明的机器人如何解开一个谜题。你给了机器人一个大脑(大语言模型),但大脑需要一个身体和一套规则来实际开展工作。这个“身体与规则”的组合被称为护套(harness)。你可以把护套看作是机器人的操作系统:它决定了机器人如何查找信息、如何使用像计算器或代码编辑器这样的工具,以及如何记住自己刚刚做了什么。如果护套很混乱或令人困惑,即使是最聪明的大脑也会跌跌撞撞。
长期以来,构建一个好的护套就像是在手动调校一辆赛车。专家们必须猜测哪里出了问题,调整几根电线,进行测试,然后祈祷一切顺利。但最近,科学家们发现,机器人实际上可以帮助修复自己的身体。它们可以尝试一种改变,观察是否奏效,记住结果,然后再次尝试。这被称为自我进化(self-evolution)。其核心思想是,如果机器人能为它所有的尝试记录一份日记,它就能从错误中学习并随着时间的推移变得更好。但问题在于:仅仅拥有一个日记并不意味着机器人知道如何阅读它。有时候,昨天奏效的小技巧到了今天可能会变成一场灾难,因为机器人的处境发生了变化。这篇论文探讨的是:我们如何确保机器人能从历史中吸取正确的教训,而不是被过时的建议所误导?
问题所在:机器人混乱的日记
想象一下,你正在训练一只狗去捡球。你扔出球,狗跑过去,有时它接住了,有时它掉了。你在笔记本上记录下每一次尝试。现在,想象一下狗换了一个新项圈,或者风向变了,或者你把网球换成了吱吱作响的玩具。如果你只是看着笔记本说:“上次狗向左跑时掉了球,所以它应该总是向右跑”,那你可能就错了。那个旧的教训可能不再适用于新的情况。
这正是 AI 智能体(AI agents)面临的情况。研究人员发现,当机器人试图通过查看其整个尝试历史来改进自己的“护套”时,它们经常陷入循环。它们可能会尝试一种修复方案,发现失败了,再尝试另一种,又失败了,然后突然又回到了几周前失败的方法上。它们的表现像是在坐过山车一样忽高忽低,而不是平稳地爬坡。研究人员意识到,机器人主要面临两个问题:
- “这还适用吗?”的问题: 机器人没有检查它的旧教训是否仍然有效。它把每一次过去的成功或失败都当作发生在此时此刻,尽管机器人的代码已经发生了变化。
- “下一步该做什么?”的问题: 即使机器人记住了教训,它也不知道具体应该修复身体的哪个部分,或者应该如何修复。这就像是被告知“你掉了球”,却没有被告知“你需要抓紧你的手掌”。
解决方案:DREvo(聪明的图书管理员)
为了解决这个问题,作者创建了一种名为 DREvo 的新方法。你可以把 DREvo 想象成一位管理机器人日记的超级有序的图书管理员。DREvo 不仅仅是把一叠纸交给机器人,它还会组织信息,检查信息是否仍然相关,并给机器人一个清晰、具体的下一步指令。
DREvo 通过三个有趣步骤来实现这一点:
1. “标签生成器”(函数级证据锚定)
在旧的方法中,机器人的日记是一个巨大的、混乱的文本块。DREvo 将这个文本块切割成细小的、带有标签的碎片。它观察机器人做的每一次改变,并将其标记到特定的“函数”(比如某个特定的工具或记忆规则)上。这就像是将一本混乱的食谱拆解开,将每一种食材的变化精确地标注到它所属的步骤上。这样,当机器人想要学习时,它确切知道过去的教训是在谈论它身体的哪个部分。
2. “新鲜度检查员”(状态依赖的证据重新校准)
这是最重要的部分。在机器人使用旧教训之前,DREvo 会问两个问题:“这个教训仍然可靠吗?”以及“这个教训符合机器人现在的身体吗?”
- 可靠性: 这个教训在以前每次使用时都奏效吗,还是仅仅是一次幸运的猜测?
- 新鲜度: 机器人的代码是否仍与学习该教训时相似?如果机器人改变了它的“抓握方式”(其代码结构),那么关于抓握的旧教训可能就不再适用了。
DREvo 会给每个教训打分。如果一个教训很陈旧或者机器人变化太大,分数就会下降,机器人就会忽略它。如果教训很新鲜且可靠,分数就会保持在高位。
3. “教练的哨声”(基于角色的搜索意图提炼)
最后,DREvo 不仅仅是给机器人一份事实清单,它还会给它一个行动计划。基于高分的教训,DREvo 会为下一次尝试分配一个特定的“角色”:
- 利用(Exploit): “这个技巧以前效果很好!再做一次!”
- 避免(Avoid): “这个技巧上次导致了崩溃!不要再做了!”
- 重测(Retest): “我们还不确定这个,让我们仔细尝试一下,看看现在是否奏效。”
- 探索(Explore): “我们没有好的线索。让我们尝试一些全新的东西。”
这把机器人模糊的“我需要变得更好”的感觉,转化为了清晰、可操作的命令,例如:“使用‘利用’策略去修复记忆工具。”
研究发现
研究人员在五个不同的挑战上测试了 DREvo,涵盖了从解决化学谜题、诊断医学症状到修复计算机代码以及在虚拟终端中导航等任务。他们将 DREvo 与其他尝试自我进化的机器人以及具有人类设计护套的机器人进行了对比。
结果非常令人振奋。在有限的尝试预算下(意味着他们没有让机器人练习到无穷尽),DREvo 在每一个类别中都找到了最好的护套。
- 在医学诊断任务中,DREvo 达到了 89.2% 的准确率,比第二名高出 2.4 个百分点。
- 在法律推理方面,它达到了 49.0%,比排名第二的方法高出 4.0 个百分点。
- 在化学反应预测中,它得分 25.0%,比亚军高出 9.0 个百分点。
- 对于智能体任务(如修复代码或使用计算机终端),与其它方法相比,DREvo 在推理任务上的性能平均提升了 16.2%,在智能体任务上提升了 13.8%。
或许最重要的一点是,研究人员注意到 DREvo 的进步过程是非常平滑的。虽然其他机器人的得分会剧烈波动(出现退步和恢复),但 DREvo 的准确率是稳步上升的。它还能将自己的“思考空间”(上下文)控制在很小的范围内,大约为 2.9K token,而其他方法需要超过 5.3K token,且表现更差。
总结
论文表明,仅仅给机器人一段过去的历史是不够的。要实现真正的学习,机器人需要一个能够检查旧教训是否仍然适用,并将这些教训转化为清晰、具体指令的系统。DREvo 充当了这样一个系统,它将混乱的试错历史转化为一条平滑、可靠的进步之路。它证明了,通过聪明地利用我们的过去经验,我们可以帮助 AI 智能体进化得更快、更可靠,即使我们在没有无限时间进行练习的情况下也是如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。