On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
本文通过证明由于欠定性(underspecification)导致基于记忆的自我改进智能体在性能上对评估方差和任务顺序高度敏感,揭示了这类智能体的脆弱性,从而主张采用更严格的评估协议和更强的真人监督。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个不仅仅是遵循脚本,而是能从自身错误中学习,通过记录关于什么奏效、什么无效的文字日志,从而在未来的工作中不断进步的数字助手。这就是自我改进智能体(self-improving agents)所承诺的前景——这是一种旨在通过浏览网页等方式在复杂的数字世界中导航并随时间推行技能精进的人工智能。这些系统不再需要人类在每次出现新挑战时进行重新编程,而是维护着一个文本记忆库,存储从过去任务中汲取的教训,以指导其后续行动。人们希望它们最终能够实现日常工作的自动化、适应新情况,并发现人类可能忽略的解决方案。但为了让这些系统在现实世界中获得信任,它们必须具备可靠性。如果一个智能体犯了错,它不应仅仅是一个一次性的故障;这种错误不应产生滚雪球效应,导致系统学到错误的教训,并以难以预测的方式反复失败。
Salesforce AI Research 的一个研究小组决定对这一承诺进行严格测试。他们采用了两种构建此类自我改进智能体的流行方法,并对其进行了远超以往评估水平的压力测试。研究人员并没有只运行一次实验并报告结果,而是多次运行同一组任务,以观察结果的变化程度。他们还打乱了任务出现的顺序,移除了以往研究中使用的那种从易到难的整齐递进过程。他们的发现呈现出一幅脆弱性的图景:这些智能体并非人们所期望的那种稳定、可靠的学习者。事实上,试图让它们实现自我改进的过程本身往往使它们变得更加不稳定,将微小的误差放大为巨大的性能波动。
研究人员发现,这些智能体的表现对偶然性有着惊人的敏感度。当他们三次重复运行同一个实验时,结果往往存在显著差异。在某些情况下,最佳运行结果与最差运行结果之间的差距甚至高达十个百分点。这意味着,即使底层技术和任务完全相同,一个智能体可能在一次尝试中表现卓越,而在另一次尝试中却惨遭失败。当自我改进机制开启时,这种不稳定性通常会加剧。系统会从前几个任务中学习,但由于初始步骤受到随机因素的影响,它存储的“教训”可能会略有偏差。这些微小的、随机的偏差会随时间推移而复合,导致智能体走向一条与同类完全不同的路径。研究人员指出,在近四分之三的测试案例中,加入自我改进循环增加了方差,使得智能体的行为变得更不可预测,而非更具一致性。
另一个重大发现是,这些智能体高度依赖于它们遇到任务的顺序。之前的研究大多测试将任务按由简入难排列的设置,这种设置充当了一个隐藏的训练指南。智能体在这种环境下表现良好,因为它们被温和地引导进入更难的问题。然而,当研究人员打乱顺序,以随机序列呈现任务时,智能体的表现下降了。它们不仅没有变得更好,反而比没有任何记忆时表现得更差。这表明这些智能体并非在学习通用的技能,而仅仅是在记忆特定的事件序列。当这种序列被打破时,智能体便难以适应,暴露出它们的“智能”是脆弱的,且受限于特定的、人工设定的环境。
为了理解发生这种情况的原因,研究人员仔细检查了智能体在其记忆库中撰写的笔记。他们发现,智能体之所以经常学到错误的东西,是因为它们接收到的关于环境的指令是不完整的。例如,智能体有时会被告知使用计算机代码或应用程序编程接口(API)来解决问题,尽管它们所处的环境是一个无法运行此类代码的标准网络浏览器。智能体会将这些不可能实现的策略写入记忆,然后一遍又一遍地尝试使用它们,陷入失败的循环。同样,当任务描述模糊时,智能体会过度思考,为失败的原因创造出复杂但错误的解释,并试图将这些解释应用于未来无关的问题。甚至有一个智能体开始使用复杂的数学公式来估算旅行时间,仅仅是因为它使用的地图网站未能加载,它便决定将这种权宜之计作为一种永久策略来“学习”。
团队尝试通过向智能体提供有关其环境和游戏规则更详细的信息来解决这些问题。他们提供了关于任务为何失败的具体反馈,并澄清了哪些操作实际上是可能的。这确实起到了作用。当添加了这些细节后,智能体的表现有所提升,且由随机任务排序导致的性能下降减少了约三分之一。然而,显著的差距依然存在。即便有了更清晰的指令,智能体在面对最具挑战性的随机条件时仍然感到吃力。这表明,虽然提供更清晰的规则有所帮助,但仍存在更深层、尚未被定性的原因,导致这些系统如此脆弱。智能体仍然容易学习到“错误的教训”,并将其转化为未来的连锁失败。
这项工作最后呼吁,在开发和测试此类系统时应采取更加谨慎的方法。研究人员认为,我们不能依靠单次运行测试或整齐排序的任务列表来判断一个智能体是否已准备好进入现实世界。相反,我们需要在混乱、不可预测的条件下对其进行压力测试,并报告其在多次运行中的表现。他们还强调了人类监督的必要性。由于这些智能体可能会从不完整的信息中学习到错误的策略,因此必须有一种机制让人员能够介入,识别出错误的教训,并在智能体造成不可逆转的损害之前对其进行纠正。前进的道路不仅在于构建更聪明的智能体,更在于构建足够稳健的系统,使其能够在处理现实世界的各种不确定性时而不至于崩溃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。