Adaptive Auto-Harness: Sustained Self-Improvement for Agentic System Deployment on Open-Ended Task Streams
本文介绍了一种名为 Adaptive Auto-Harness 的框架与系统,该系统通过将性能差距分解为演化损失(evolution loss)与适应损失(adaptation loss),并利用一个具有状态的多智能体演化器、一个带有求解时路由的束架树(harness tree)以及人类引导钩子,旨在使大语言模型(LLM)智能体能够在开放式任务流中实现持续的自我提升,从而在动态且异构的任务上超越现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:一个“永不停歇”的机器人
想象你有一个非常聪明的机器人助手(AI Agent),你想让它从事一项永无止境的工作。你不想只给它一套固定的规则然后就放任不管,而是希望它在面对每天涌现的新奇、怪异且不同的任务时,能够不断学习并变得越来越强。
问题在于,目前的多数 AI 系统就像是只为某一场特定考试而学习的学生。它们能把那场考试考得很好,但如果第二天你给它们换了一个科目,它们就会忘掉之前学过的东西,或者陷入混乱。如果你试图不断向它们的脑中添加新规则,以覆盖未来可能出现的每一种任务,它们的脑子就会变得过于臃�杂,导致运行变慢,甚至开始在以前擅长的旧任务上出错。
这篇论文介绍了一种名为 Adaptive Auto-Harness(自适应自动挂载系统) 的新系统。你可以把它想象成一个聪明的车间经理,它负责为机器人构建并组织一个工具箱,确保机器人始终拥有应对当前任务的“正确工具”,而不会被不需要的工具搞得应接不暇。
三大难题(“为什么”)
作者指出,现实世界的 AI 工作具有三个棘手的特征,是旧系统无法处理的:
无止境的流式输入 (Unbounded): 工作不会停止。新的任务会源源不断地到来。旧系统试图记住过去发生的一切,这最终会填满它们的记忆,使它们变得缓慢。
- 类比: 想象一位厨师试图记住过去 10 年里做过的每一道菜谱。最终,因为大脑被旧菜谱占满了,他反而记不起现在需要做的这道新菜。
任务的多样性 (Heterogeneity): 任务千差万别。前一分钟机器人还在做数学题,下一分钟可能在写诗,再下一分钟可能在破解安全系统。
- 类比: 想象一把瑞士军刀,它试图同时成为螺丝刀、开瓶器和锯子,并且永久性地粘在你的手上。它既重又笨拙。你最好还是准备一个专门的工具抽屉,根据任务挑选合适的工具。
移动的目标 (Non-Stationarity): 游戏规则随时间而变化。上个月行之有效的办法,今天可能就没用了。
- 类比: 想象你在玩一款地图每天都在变化的电子游戏。如果你死记硬背了第一天的寻宝路径,到了第十天你就会迷路。
解决方案:“Adaptive Auto-Harness”
作者构建了一个利用三种主要技巧来解决这些问题的系统。
1. “专家团队” (多智能体进化/Multi-Agent Evolution)
与其让一个 AI 试图独自摸索如何改进自己(这很难且很慢),他们使用了一个由专业化 AI 智能体组成的团队,通过一个循环协同工作。
- 分析师 (The Analyst): 观察机器人在哪里失败了,并说:“嘿,我们需要更好的方法来处理这个。”
- 研究员 (The Researchers): 出去寻找新的想法或工具来解决问题。
- 构建者 (The Builders): 实际编写代码或更新指令。
- 验证者 (The Verifiers): 测试新指令,确保它们在投入使用前确实有效。
- 类比: 与其让一个人独自盖房子,不如配备一名建筑师、一支施工队和一名质检员。他们轮班工作,因此房子会被建造得更好、更快,且不会有人感到疲劳或困惑。
2. “智能分支系统” (执行时路由/Solve-Time Routing)
这是最重要的部分。该系统不会保留一本巨大且混乱的说明书。相反,它构建了一棵专业化工作空间的树 (Tree of Specialized Workspaces)。
- 想象一座图书馆。与其把所有主题混在一起的一本巨著,不如设立不同的区域:如“体育”、“政治”、“金融”。
- 当新任务到达时,一个路由智能体 (Router Agent) 会观察任务并判断:“这是一个体育类问题。让我们进入‘体育分支’。”
- 机器人随后会“借阅”那个特定的分支,使用专为体育设计的工具和规则,并忽略掉政治类的规则。
- 类比: 这就像一家医院。如果你腿骨折了,你应该去骨科。你不会去心内科并尝试阅读心脏手术手册。系统保持了各个“科室”的独立,从而避免了错误建议的干扰。
3. “人类安全网” (人机协同/Human-in-the-Loop)
有时,机器人会遇到从未见过的难题,比如需要一个秘密密码或某个它不知道的特定网站。系统无法凭空创造出这些信息。
- 在这种罕见情况下,系统设有一个“紧急按钮”,可以向人类寻求快速提示。
- 类比: 如果一个机器人在尝试打开一扇锁着的门,但手头没有钥匙,它不会对着门一直撞。它会询问人类:“你有钥匙吗?”一旦人类给了钥匙,机器人下次就会学会如何寻找钥匙。
研究发现 (结果)
团队在三个截然不同的长期运行任务流上测试了这个系统:
- 预测市场 (Prediction Markets): 预测体育和政治事件的结果。
- 安全挑战 (Security Challenges): 解决计算机黑客解谜 (CTF)。
- 事件预测 (Event Forecasting): 预测未来的新闻事件。
结果显示:
- 旧系统: 起初表现良好,但随后性能下降。它们变得“臃肿”且混乱。
- Adaptive Auto-Harness: 随着时间的推移,它的表现持续提升。通过利用“专家团队”来构建更好的工具,以及利用“智能分支”来挑选正确的工具,它解决的问题远多于旧系统。
- “人类”因素: 当系统因为缺乏特定信息(如某个网站链接)而卡住时,人类的快速引导帮助它恢复并学习,这证明了有时一点点人类的帮助比让 AI 独自摸索要有效得多。
总结
论文认为,要让 AI 在现实世界中真正发挥作用,我们不能只给它一套静态的规则。我们需要一个这样的系统:
- 利用一组 AI 工作者随时间构建新技能。
- 将这些技能组织进不同的“房间”,以免 AI 产生混乱。
- 根据任务在这些“房间”之间进行快速切换。
这使得 AI 能够不断进化,而不会因为试图记住一切而产生“脑雾”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。