← 最新论文
🤖 machine learning

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

EvoClawBench 是一个评估 AI 智能体能否有效地将其自身执行过程中的证据转化为可重用技能的新基准,它揭示了这种自我学习产生的是高度选择性和依赖于运行时的结果,而非提供自动化的性能提升。

原作者: Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一个超级聪明的机器人助手,名叫“Agent”。你交给它一个杂乱的工作,比如整理一个混乱的库房或者修复一段损坏的游戏代码。机器人尝试去完成它,完成尝试(结果可能是完美的,也可能带有错误), 然后你问它:“嘿,机器人能不能观察它自己的工作,从中学习一个技巧,把这个技巧写成一份‘小抄’,然后利用这份小抄在做下一次任务时更快、更好地完成?”

这就是 EvoClawBench 论文所探讨的核心问题。这就像是在测试一个学生是否可以参加考试,批改自己的答案解析,根据自己的表现编写一份学习指南,然后仅凭这份指南就在下次考试中取得优异成绩。

大型实验:三种玩法

研究人员设置了 100 个不同的“任务”(如编程、修复电子表格或分析安全日志),并以三种不同的方式测试了机器人:

  1. “冲冲冲”模式(基准模式/Baseline): 机器人接到任务后直接开始做。没有笔记,没有小抄。只有纯粹的努力。
  2. “赛前热身”(预习模式/Preskill): 在机器人动手做任务之前,它先尝试预测任务的需求并预先写好一份小抄。然后,它利用这份小抄来完成任务。
  3. “赛后复盘”(复盘模式/Postskill): 机器人先从零开始完成任务。然后,系统会对第一次尝试进行评分,并向机器人总结发生了什么(即使失败了或出错了)。 机器人利用这个总结来编写一份小抄,然后使用这份新小抄再次尝试执行同一个任务。

令人震惊的结果:它并非万能灵药

你可能会想:“当然了!如果你写下了如何做某事的方法,你自然会做得更好!”但论文指出情况要复杂得多。从自身的运行中学习并不是一种自动获得的超能力。 它更像是一场赌博。

以下是数据(以及论文细致的测量)告诉我们的信息:

  • 机器人的“大脑”比笔记更重要:
    结果高度取决于使用了哪种机器人模型。

    • 其中一个机器人(名为 nanobot,使用模型 GPT-5.4)本身已经非常擅长这项工作,即使没有任何小抄,得分也超过了 96%。添加小抄并没有带来太大帮助,分数依然维持在 96% 左右。
    • 但另一个机器人(nanobot,使用 DeepSeek-V4-Pro)最初的表现尚可,得分为 77.77%。当它尝试使用在开始前编写的小抄(Preskill)时,分数暴跌至 4.80%。当它尝试使用在完成第一次尝试后编写的小抄(Postskill)时,分数更是跌到了 0.99%
    • 翻译一下: 有时候,写下一份“操作指南”反而会让机器人感到困惑,导致表现变差!
  • “小抄”可能是一个陷阱:
    论文发现这些自我编写的技能具有选择性和成本敏感性

    • 成本: 编写小抄需要时间,也需要消耗计算机的“脑力”(Token)。对于某些机器人来说,编写指南所花费的时间太长,以至于即使指南有一点点帮助,整个过程也比不写笔记直接做两次任务更慢、更贵。
    • “过拟合”问题: 论文暗示,当机器人基于单次尝试编写指南时,它可能会变得过于具体。它可能会写下:“点击左边的红按钮”,但下一次任务的按钮可能在右边。这份指南变成了一个坏习惯,而不是一个有用的提示。
  • 笔记越多并不意味着分数越高:
    研究人员统计了机器人编写了多少份小抄。有些机器人写了 20 或 30 份!但拥有 30 份小抄并不保证会有更高的分数。事实上,有些写了更多小抄的机器人,表现反而比写得少的机器人更差。质量才是关键,而非数量

论文排除了什么

论文非常明确地说明了它没有证明什么:

  • 没有证明智能体可以通过学习旧任务来自动提升处理新的、不同的任务的能力。测试针对的是重复执行同一个任务。我们目前还不知道这些小抄是否适用于全新的谜题。
  • 没有暗示在每个机器人中加入一个“技能编写”步骤是稳赚不赔的。在许多情况下,这纯粹是浪费时间和金钱。

底线结论

论文表明,教导智能体从自身的运行中学习是非常棘手的。 这不是让机器人变聪明的魔法按钮。有时候,“小抄”本身就是一个错误的地图,会导致机器人掉进沟里。

目前来看,最好的方法似乎是精挑细选:只有当机器人确定指南确实有用,且编写它的成本不会过高时,才允许它编写小抄。这是一个可以发挥作用的工具,但它绝非免费的午餐。机器人必须小心,不要过度解读自己的错误!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →