Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
本文介绍了 Harness Handbook,一种以行为为中心的表示方法和行为引导的渐进式披露(BGPD)方法,该方法能够自动将高层行为需求映射到特定的源代码位置,从而克服定位瓶颈,并提高演进复杂 AI 智能体测试桩(harness)的效率与质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚制造了一个超级智能的机器人助手。你给了它一个大脑(一个庞大的 AI 模型),并对它说:“去修理我的电脑!”但仅仅有大脑是不够的。机器人还需要一个身体、一套神经系统,以及一套关于如何移动手指、如何握住螺丝刀以及如何判断是否完成任务的指令。在 AI 的世界里,这个“身体和神经系统”被称为控制框架(harness)。它是软件层,负责告诉 AI 何时说话、何时使用工具,以及如何记住它刚刚做了什么。
现在,想象你想升级那个机器人。也许你想让它在删除文件之前更加谨慎,或者也许你想让它在完成任务前检查三次而不是一次。在过去,人类程序员必须翻遍成千上行的代码,试图弄清楚在机器人的神经系统中,那个“检查你的工作”的规则究竟隐藏在何处。这就像是在试图从一个巨大的、纠缠在一起的毛线球中找到一根特定的神经,却没有任何地图。代码通常分布在许多不同的文件中,与其他的逻辑混杂在一起,难以追踪。如果你漏掉了哪怕一个微小的点,你的机器人仍可能误删文件。这篇论文解决了寻找这些隐藏位置的挫折性问题,以便我们能够安全地升级我们的 AI 助手。
由 Ruhan Wang 及其同事领导的研究团队意识到,最大的瓶颈不在于教 AI 如何 进行更改,而在于帮助人类(或其他 AI 智能体)弄清楚在哪里进行更改。他们将这个问题称为行为定位(behavior localization)。为了解决这个问题,他们发明了一种叫做 Harness Handbook(控制框架手册) 的东西。
请不要把 Harness Handbook 仅仅看作是一份文件清单,而要把它看作是机器人的行为用户手册。与其按“文件 A、文件 B、文件 C”(这是代码通常存储的方式)来组织信息,Handbook 是按“机器人实际做了什么”来组织信息的。这就像拥有一本指南,上面写着:“如果你想改变机器人处理‘任务完成’信号的方式,这里是其大脑中处理该信号的三个特定位置,以及它们之间是如何通信的。”
该团队构建了一个系统,通过阅读机器人的代码并使用智能 AI 来绘制连接图,从而自动生成这个 Handbook。他们将使用这种地图的方法称为行为引导式渐进式披露(Behavior-Guided Progressive Disclosure)。想象一下你正在修理一个复杂的时钟。你不是盯着 500 个齿轮和弹簧发呆,而是打开了一本手册,它首先向你展示“计时”部分,然后放大到“时针”齿轮,最后高亮显示你需要转动的那个精确的螺丝。Handbook 对 AI 代码也是如此:它从系统功能的宏观概述开始,然后引导用户深入到需要编辑的具体代码行。
研究人员在两个真实的 AI 系统(称为 Terminus-2 和 Codex)上测试了这个想法。他们要求编程智能体根据简单的请求进行修改,例如:“让机器人在给任务评分前请求确认三次。”他们对比了两组:一组必须用传统方式(搜索文件)来寻找代码,另一组则使用 Harness Handbook。
结果非常明确。使用 Handbook 的那一组在寻找正确编辑位置方面表现得好得多。他们犯的错误更少,不会意外地更改不该更改的内容,而且这一切都使用了更少的计算资源(更少的“token”,即 AI 用来思考的货币)。当代码很混乱、分布在许多文件中,或者隐藏在系统极少运行的部分时,Handbook 显得尤其有用。事实上,使用 Handbook 的智能体在寻找正确代码方面表现得如此出色,以至于一个“较弱”的 AI 模型只要拥有这张地图,就能表现得几乎和“较强”的模型一样好。
论文指出,随着 AI 系统变得越来越复杂,我们不能仅仅依赖更聪明的大脑;我们需要更好的地图。Harness Handbook 证明了,如果我们围绕着系统在做什么而非文件在哪里来组织代码,我们就能让进化这些强大的智能体变得更加安全、快速且可靠。它将理清巨大毛线球的混乱任务,变成了一场在明亮图书馆中受引导的简单旅程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。