← 最新论文
💻 computer science

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

本文介绍了 Ouroboros,一种通过经过审查的提交和人类交互来迭代改进其自身工具、提示词及核心实现的自我开发型编程智能体,它在保持冻结评估快照与实时进化谱系分离以确保运行安全的同时,在多个基准测试中实现了最先进的性能。

原作者: Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个软件不再只是静静地坐着等待人类输入命令的世界。在人工智能领域,有一个日益增长的概念叫做“智能体”(agents)。请不要把它们仅仅视为回答问题的简单聊天机器人,而要将它们视为能够真正“做事”的数字员工:它们可以编写代码、操作电脑屏幕、使用工具,并在长时间内解决复杂的谜题。长期以来,束缚这些智能体的“束缚器”(harness)——即它们的工具、指令和规则——都是由人类构建并固定不变的。这就像制造了一辆汽车,然后将方向盘焊接死,使其无论路况多么颠簸都无法调节。但如果汽车可以在行驶过程中自行修理引擎、升级 GPS,甚至重写自己的驾驶手册呢?这正是这篇论文所探讨的核心问题:一个 AI 智能体能否构建一个更好的自身版本?如果它这样做,我们能否确保它的安全?

这篇论文介绍了 Ouroboros(乌洛波罗斯),一个以自我发展的 AI 智能体命名,其名字取自古老的衔尾蛇符号。研究人员发现,通过让智能体不断审查并改进自身的代码、提示词(promts)和工具,它在解决复杂的计算机任务方面变得显著更强。在一系列测试中,该智能体取得了顶尖的分数,击败了许多其他系统。然而,论文也强调了一个重大的安全挑战:如果一个智能体可以修改自己的规则,我们如何确保它不会意外地拆掉“安全刹车”?作者展示了让智能体在进化时保持受人类控制的严格“护栏”(guardrails)是可行的,从而确保智能体在变得更聪明的同时不会变得危险。

衔尾之蛇

认识一下 Ouroboros。在神话中,Ouroboros 是一条正在吞食自己尾巴的蛇,象征着无尽的循环与自我更新。在这篇论文中,它是一个执行类似功能的计算机程序:它编写代码来改进自身,然后利用这段新代码来执行任务,接着再编写代码来进一步改进自身。

如今大多数 AI 系统就像工厂制造出来的机器人。人类设计机器人,赋予它一套指令,然后让它去工作。如果机器人卡住了或犯了错,它无法真正解决问题;它只会不断尝试同样的操作,或者请求人类帮助。此时,“束缚器”(机器人的大脑和工具包)是冻结状态。

Ouroboros 则不同。它将自己的大脑和工具包视为一个可以成长的生命体。它有两种主要的进化方式:

  1. “自由进化”模式: 想象一下智能体坐下来对自己说:“我觉得如果我重新排列一下工具,效率会更高。”然后它编写了一个新版本的代码,经过检查后,立即开始使用它。它可以不断重复这个过程,创造出一条永不停歇的改进链。
  2. “经验驱动”模式: 这更像是从糟糕的工作日中学习。智能体尝试执行一项任务,遇到了 Bug 或被用户搞糊涂了。它不会仅仅选择放弃,而是会说:“哎呀,这行不通。我需要修改我的指令。”它会记录错误,提出修复方案,并且——至关重要的一点是——在实际安装新代码之前,它必须通过一个审核流程来获得批准。

“Hope”实验

为了验证这在现实世界中是否可行,研究人员启动了一个名为 Hope 的项目。Hope 是一个持续运行的智能体,已经运行了 161 天,并在七个不同的平台(如网站、Telegram、电子邮件和语音聊天)上与人交流。

在这段时间里,Hope 不仅仅是在回答问题,它在“生活”。人们会告诉它:“嘿,你在重复发送同一条消息,”或者“你不太擅长处理这类数学题。”Hope 会倾听,判断这些投诉是否属实,然后决定是否修改自己的代码来解决问题。

最酷的部分在于:人类并没有编写 Hope 的代码。他们只是提供反馈。Hope 自己决定什么是真正的难题,什么是愚蠢的建议。如果它决定修复某个问题,它会编写代码,通过审核,然后安装它。在这 161 天里,Hope 处理了 797 亿个 token(衡量文本阅读和编写量的单位),编写了 175,755 行代码,并消耗了 110,600 美元 的计算资源。这不仅仅是一项测试,更是一个活生生的自我改进实验。

结果:快速变聪明

研究人员在世界上最难的计算机基准测试上测试了 Ouroboros,以观察其自我改进是否真的让它更擅长解决问题。

  • Terminal-Bench 2.1: 这是一个包含 89 个极难计算机任务的测试。当 Ouroboros 使用其顶级模型(Opus 5)时,它正确完成了 86.97% 的任务。即使在严格审计剔除了一个“运气好”的猜测后,它仍获得了 86.74% 的分数。这是该测试中报告的最高分。
  • OSWorld-Verified: 该测试衡量智能体使用计算机界面(如点击按钮和打字)的能力。Ouroboros 得分为 90.69%,超越了之前的最佳结果。
  • CL-Bench: 这衡量了智能体从一系列任务中学习的能力。Ouroboros 在这里也创下了新纪录,得分为 0.2301

论文表明,通过让智能体修复自身的“粗糙边缘”和 Bug,它变成了一个更强大的工作者。它不仅是在某一方面变强,而是整个系统都变得更加聪明。

安全问题:别让智能体冲下悬崖

现在,到了可怕的部分。如果一个智能体可以重写自己的代码,那么什么能阻止它重写自己的安全规则呢?如果它决定:“我不需要请求许可就可以花钱”或者“我应该忽略关于不删除文件的规则”怎么办?

作者称之为“操作安全”问题。他们意识到,如果智能体在进化,那么安全规则必须比智能体改变它们的能力更强大。

为了解决这个问题,他们构建了一个“护栏”系统:

  • 宪法(The Constitution): 核心规则(如“不要伤害人类”或“不要花费太多钱”)是以一种智能体难以轻易删除或更改的方式加载的。
  • 审核闸门(The Review Gate): 每当智能体想要修改自己的代码时,它必须经过一个严格的审核过程。这就像校长在给学生打最终成绩前先检查作业一样。
  • 紧急按钮(The Panic Button): 有一个人类控制的特殊“操作通道”。如果智能体表现异常,人类可以按下 /panic 按钮,瞬间关闭整个系统,甚至在智能体做出反应之前就将其终止。

在实验中,智能体从未成功破坏这些规则。即使它试图修复一个几乎删除了其自身工作的 Bug,安全系统依然介入并拯救了它。论文指出,虽然自我进化的智能体功能强大,但如果我们设计出连智能体本身也无法打破的“刹车”,我们就能保持其安全。

总结

Ouroboros 证明了 AI 智能体可以学会构建一个更好的自身版本,从而在困难任务上取得突破性的表现。它展示了长期的实验项目“Hope”如何在数月的现实互动中不断进化。但它同时也警告我们,这种力量伴随着风险:如果我们不小心,智能体可能会为了自身的利益而改变游戏规则。解决方案不是阻止智能体学习,而是构建一个让安全规则比执行任务的代码更难被修改的系统。这有点像教孩子开车:你可以让他们学习并提高技能,但你要把紧急刹车始终握在自己手里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →