Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
Harness-R1 引入了一种新颖的方法,该方法利用在线强化学习来训练一个专门的“束缚工程师”(harness engineer),从而从智能体失败的轨迹中自动生成可执行的运行时补丁,在无需更新目标智能体模型权重的情况下,显著提高了多个基准测试的任务成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个聪明绝顶、超级智能的机器人助手。你给它布置了一项任务,比如“寻找一件价格在20美元以下的完美红衬衫”,然后它就开始工作了。但有时,机器人会感到困惑。也许它点错了按钮,或者忘记了自己在找什么,又或者陷入了一个不断重复购买同一件物品的死循环。在人工智能的世界里,这个机器人被称为“智能体”(agent),而它那些混乱的思想、行动和错误留下的痕迹,被称为“轨迹”(trajectory)。
通常情况下,当机器人犯错时,唯一的修复方法就是回到原点,重新训练它的整个大脑。这需要耗费大量的时间和精力。但还有另一种方法:与其改变机器人的大脑,你不如改变它穿戴的“护具”(harness)。把护具想象成机器人的安全装备、它的检查清单以及它的沟通指南,它集这些功能于一身。它是告诉机器人如何与世界交流、如何检查自己的工作以及在跌倒时如何恢复的那些代码。研究人员提出的核心问题是:我们能否教会机器人根据过去的失败来修复自己的护具,而不需要每次都重新训练它的大脑?
这正是论文《Harness-R1》所探讨的内容。研究人员构建了一个系统,其中一个特殊的“工程师”AI 通过学习机器人的过往错误,来学习如何重写机器人的护具。其运作方式如下:首先,他们让一个标准的机器人(“目标”机器人)尝试解决任务并经历失败。然后,工程师 AI 会观察这些失败的故事,并编写一套新的指令——即一个“补丁”——来修复护具。至关重要的一点是,他们不仅仅是凭空猜测补丁是否有效;他们实际上是将补丁套在机器人身上,并让它再次尝试这些任务。如果机器人的成功率提高了,工程师就会获得奖励并学会编写更好的补丁。如果补丁让情况变得更糟,工程师则会学到不要再这样做。
实验结果非常酷。当他们在三种具有挑战性的游戏(在线购物、文本驱动的房屋导航和数据库管理)上进行测试时,标准机器人的成功率仅为 44.3% 左右。在 Harness-R1 工程师学会修复其护具后,成功率跃升至 53.6%。仅仅通过调整护具而非大脑,就实现了 9.3 个百分点的提升。更棒的是,他们在一个已经经过更高级训练、变得更聪明的机器人身上进行了测试,工程师仍然成功地将其性能又提升了 5.0 个百分点。
该论文还表明,这不仅仅是针对某一个特定机器人的偶然现象。他们训练出的工程师可以观察一个它从未见过的全新、不同的机器人,研究该机器人的失败之处,并为这个新机器人编写定制化的修复方案,从而帮助它取得成功。这表明,学习编辑“护具”是一种可以传授给 AI 的技能,它能让 AI 与它所帮助的机器人共同进化,使它们变得更聪明、更可靠,而无需重新训练它们的核心大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。