← 最新论文
🤖 AI

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

本文介绍了分层自我改进(HSI),这是一个由冻结的 LLM 智能体通过分层自我修改过程不断演进其特定任务执行机制的框架,该框架在中等难度任务上展示了显著的性能提升,同时受限于底层模型的能力和反馈信号的保真度。

原作者: Tailin Zhou

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Tailin Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人大脑,但它被困在一个玻璃盒子里。你无法改变它的思考方式或让它学习新事物;它的电路结构是冻结的。然而,你可以改变它居住的房间。你可以重新布置家具、给它增加新的工具,或者给它一张更好的地图。在人工智能的世界里,这个“房间”被称为护套(harness)。它是围绕着大型 AI 模型的一套指令、工具和记忆系统的集合,用以帮助它解决问题。长期以来,科学家们认为要让 AI 变得更聪明,必须升级大脑本身。但如果通过把“房间”变得如此完美,从而让那个冻结的大脑突然变成天才呢?这正是这篇论文探讨的核心问题:一个无法自行学习的机器人大脑,能否教导自己如何建造一个更好的房间?

这项研究背后的研究员 Tailin Zhou 表示:“是的,但有限制。”他们创建了一个名为**分层自我改进(Hierarchical Self-Improvement, HSI)**的系统。把它想象成一座三层建筑,每一层都住着同一个冻结的大脑,但承担着不同的工作。在底层,大脑根据一套特定的规则(护套)进行游戏。在中层,大脑观察这些规则并尝试重写它们,以获得更高的分数。在顶层,大脑观察自己是如何重写规则的,并尝试优化这个过程。其中的魔力在于,顶层的大脑在其自身的逻辑中是“冻结”的——它无法重写自身,这防止了它产生混乱或破坏一切。这就像一位厨师,他可以改变食谱(中层),甚至可以改变编写食谱书的方式(顶层),但厨师自己的双手和大脑是固定不变的。

团队在一些类似视频游戏的谜题——BALROG 上测试了该系统。他们发现,对于中等难度的游戏,该系统表现得非常出色。通过让 AI 不断重写自己的指令,它在没有改变大脑的情况下,在游戏表现上有了显著提升。例如,在名为 BabyAI 的游戏中,得分提高了 39.3%;在 Crafter 中,得分上升了 33.0%。它甚至学会了玩从未见过的全新关卡,证明它不仅仅是在死记硬背答案。然而,论文也发现了一个硬性瓶颈:如果游戏对于这个冻结的大脑来说过于复杂(比如一个非常复杂的地下城探索游戏 NLE),那么无论如何重新布置房间都无济于事。大脑根本无法生成学习所需的正确信号。

因此,核心结论是:通过让固定的 AI 不断升级自己的“用户手册”和“工具包”,你可以压榨出更多的性能;但你无法通过改变家具,就把一个弱小的脑子变成超级大脑。这种提升是真实的、可衡量的且极其有效的,但它受限于原始大脑本身的智能水平。

三层楼的大脑构建

为了理解其运作机制,请想象一个单一的、冻结的 AI 大脑(我们称之为“M”),它太聪明了以至于无法学习新事实,但也太固执了以至于无法修改自己的代码。研究员为这个大脑建造了一座三层建筑,每一层代表一项不同的工作。

地面层:玩家
在这里,大脑 M 正在玩游戏。它拥有一个“护套”(H),这就像一套定制的盔甲,配备了特定的工具集、一个记忆笔记本以及一套与游戏沟通的规则。这是实际执行工作的部分。如果游戏目标是“寻找红色钥匙”,那么护套会告诉大脑如何寻找钥匙以及将钥匙放在哪里。

第二层:建筑师
在楼上,同样的大脑 M 现在扮演着建筑师的角色。它观察地面层的玩家,观察玩家在哪里失败了,然后重写护于。它可能会说:“嘿,玩家一直忘记钥匙在左边的房间里。让我们在记忆系统中加一张便签吧。”这就是进化器(Evolver)。它不玩游戏,它只是改变了玩家的游戏规则。

第三层:蓝图设计师
在最顶层,大脑 M 现在是蓝图设计师。它观察第二层的建筑师。也许建筑师修改规则的速度太慢,或者它总是犯同样的错误。于是,设计师会重写建筑师的策略。它可能会说:“不要只看最后 5 步,要看最后 20 步。”这就是元进化器(Meta-Evolver)

安全锁
这里是最重要的一部分:这座建筑有一个安全锁。蓝图设计师(顶层)可以改变建筑师的策略,但它无法修改自己的代码。运行顶层的代码是“冻结”且不可更改的。这防止了系统陷入一个试图无限重写自身并最终导致崩溃的循环。这就像一位老师可以改变学生的教学计划,校长可以改变老师的教学计划,但校长的职位描述是刻在石头上的,不可更改。

“思考开/关”开关

为了确保 AI 不仅仅是通过消耗更多的脑力来解决谜题,研究人员使用了一个巧妙的技巧。当大脑在“玩”游戏(地面层)时,他们关闭了它的“思考”模式。它必须根据第一直觉行动。但当它在“重写”规则(第二层和第三层)时,他们重新开启了思考模式。这证明了改进来自于更好的规则(护套),而不是大脑突然变聪明了或思考时间变长了。

结果:何时成功,何时失败

团队在名为 BALROG 的基准测试上测试了该系统,这是一个包含不同难度等级的文本冒险游戏集合。

成功案例
在中等难度的游戏中,该系统表现得像个明星。

  • BabyAI: 得分提高了 +39.3%
  • Crafter: 得分上升了 +33.0%
  • TextWorld: 提升了 +25.0%
  • MiniHack: 获得了 +15.0% 的增益。

更令人印象深刻的是,当他们在名为 BabaIsAI 的游戏中测试该系统时,AI 学到了适用于从未见过的新关卡的规则。在其中一个名为“BreakStop”的子游戏中,它得到了 0.98 的分数(接近完美);在“GoTo”中,它得到了 1.00(完美)。这意味着 AI 不仅仅是死记硬背它练习过的特定关卡,它实际上学会了如何构建一种可以重复使用的更好策略。

硬性极限
然而,论文也发现了一个明确的边界。当他们尝试在难度极高的游戏 NLE(需要深度推理且线索极少)上进行测试时,系统未能实现改进。得分始终保持在 0.0

为什么?因为这个冻结的大脑首先就无法理解这个游戏。护套可以重新排列工具,但它无法给大脑提供新的眼睛去观察解决方案。论文指出,护套进化就像是一个乘数:如果大脑对某项任务已经具备一定的能力,护套可以让它变得卓越;但如果大脑对该任务完全无能为力,无论如何重新排列工具,也无法让它变得优秀。

这对未来意味着什么

这项研究表明,我们有一种无需训练大规模、昂贵的新模型就能让 AI 变得更好的新方法。与其试图构建一个更聪明的大脑,我们可以为大脑构建一个更聪明的“房间”。论文表明,只要任务不是太难,并且 AI 能从其行为的正误中获得清晰的反馈,单个冻结的 AI 就可以教导自己如何改进自己的指令。

这有点像给一个人一套固定的技能,但允许他们设计自己的工作室。如果工作在他们的技能范围内,他们可以建造一个如此高效的工作室,使他们成为一名大师级匠人。但如果工作需要他们并不具备的技能,再好的工作室设计也无法帮他们完成任务。论文证明,对于许多任务而言,工作室的设计正是解锁我们现有工具全部潜力的关键所在。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →