想象一下你有一个超级聪明的机器人助手,名叫“Agent”。你交给它一个杂乱的工作,比如整理一个混乱的库房或者修复一段损坏的游戏代码。机器人尝试去完成它,完成尝试(结果可能是完美的,也可能带有错误), 然后你问它:“嘿,机器人能不能观察它自己的工作,从中学习一个技巧,把这个技巧写成一份‘小抄’,然后利用这份小抄在做下一次任务时更快、更好地完成?”
这就是 EvoClawBench 论文所探讨的核心问题。这就像是在测试一个学生是否可以参加考试,批改自己的答案解析,根据自己的表现编写一份学习指南,然后仅凭这份指南就在下次考试中取得优异成绩。
大型实验:三种玩法
研究人员设置了 100 个不同的“任务”(如编程、修复电子表格或分析安全日志),并以三种不同的方式测试了机器人:
- “冲冲冲”模式(基准模式/Baseline): 机器人接到任务后直接开始做。没有笔记,没有小抄。只有纯粹的努力。
- “赛前热身”(预习模式/Preskill): 在机器人动手做任务之前,它先尝试预测任务的需求并预先写好一份小抄。然后,它利用这份小抄来完成任务。
- “赛后复盘”(复盘模式/Postskill): 机器人先从零开始完成任务。然后,系统会对第一次尝试进行评分,并向机器人总结发生了什么(即使失败了或出错了)。 机器人利用这个总结来编写一份小抄,然后使用这份新小抄再次尝试执行同一个任务。
令人震惊的结果:它并非万能灵药
你可能会想:“当然了!如果你写下了如何做某事的方法,你自然会做得更好!”但论文指出情况要复杂得多。从自身的运行中学习并不是一种自动获得的超能力。 它更像是一场赌博。
以下是数据(以及论文细致的测量)告诉我们的信息:
机器人的“大脑”比笔记更重要:
结果高度取决于使用了哪种机器人模型。
- 其中一个机器人(名为 nanobot,使用模型 GPT-5.4)本身已经非常擅长这项工作,即使没有任何小抄,得分也超过了 96%。添加小抄并没有带来太大帮助,分数依然维持在 96% 左右。
- 但另一个机器人(nanobot,使用 DeepSeek-V4-Pro)最初的表现尚可,得分为 77.77%。当它尝试使用在开始前编写的小抄(Preskill)时,分数暴跌至 4.80%。当它尝试使用在完成第一次尝试后编写的小抄(Postskill)时,分数更是跌到了 0.99%。
- 翻译一下: 有时候,写下一份“操作指南”反而会让机器人感到困惑,导致表现变差!
“小抄”可能是一个陷阱:
论文发现这些自我编写的技能具有选择性和成本敏感性。
- 成本: 编写小抄需要时间,也需要消耗计算机的“脑力”(Token)。对于某些机器人来说,编写指南所花费的时间太长,以至于即使指南有一点点帮助,整个过程也比不写笔记直接做两次任务更慢、更贵。
- “过拟合”问题: 论文暗示,当机器人基于单次尝试编写指南时,它可能会变得过于具体。它可能会写下:“点击左边的红按钮”,但下一次任务的按钮可能在右边。这份指南变成了一个坏习惯,而不是一个有用的提示。
笔记越多并不意味着分数越高:
研究人员统计了机器人编写了多少份小抄。有些机器人写了 20 或 30 份!但拥有 30 份小抄并不保证会有更高的分数。事实上,有些写了更多小抄的机器人,表现反而比写得少的机器人更差。质量才是关键,而非数量。
论文排除了什么
论文非常明确地说明了它没有证明什么:
- 它没有证明智能体可以通过学习旧任务来自动提升处理新的、不同的任务的能力。测试针对的是重复执行同一个任务。我们目前还不知道这些小抄是否适用于全新的谜题。
- 它没有暗示在每个机器人中加入一个“技能编写”步骤是稳赚不赔的。在许多情况下,这纯粹是浪费时间和金钱。
底线结论
论文表明,教导智能体从自身的运行中学习是非常棘手的。 这不是让机器人变聪明的魔法按钮。有时候,“小抄”本身就是一个错误的地图,会导致机器人掉进沟里。
目前来看,最好的方法似乎是精挑细选:只有当机器人确定指南确实有用,且编写它的成本不会过高时,才允许它编写小抄。这是一个可以发挥作用的工具,但它绝非免费的午餐。机器人必须小心,不要过度解读自己的错误!
技术摘要:EvoClawBench
问题陈述
现有的大型语言模型(LLM)智能体基准测试主要评估任务完成情况、工具使用能力或预设技能的效用。然而,它们未能隔离一个特定的闭环学习问题:在计入编写与总结所产生的完整 Token、成本和时间开销后,智能体运行时能否将其自身完成的任务证据转化为可重用的技能,从而提升后续执行的效果?
目前的评估无法区分智能体是直接解决任务的能力,还是其从先前的尝试中提取程序性记忆并在处理类似任务时进行重用的能力。这一差距使得“技能生命周期”——包括编写、自身运行提取、重用以及变更检查——处于未明确定义的状态。
方法论:EvoClawBench
为了解决这一问题,作者引入了 EvoClawBench,这是一个旨在评估程序性记忆完整生命周期的基准测试。该基准测试由 100 个任务组成,涵盖 502 个子问题,涉及多样化的领域(编码、数据、办公、安全、运维及领域文档工作流)。每个任务都包含重复的、具有结构相关性的子问题,以创造识别模式并编码可重用程序的契机。
评估协议
该基准测试对比了针对同一任务、模型和运行时的三种不同执行策略:
- BASELINE(基准): 智能体直接解决任务,不创建或编辑任何技能。这衡量的是原始的任务解决能力。
- PRESKILL(前置技能): 智能体首先进入技能编写阶段,根据提示词创建特定于任务的技能。随后,它仅使用生成的技能在全新的工作空间中执行任务。这测试了智能体是否能在解决任务之前推断出有用的程序。
- POSTSKILL(后置技能): 智能体首先在没有技能的情况下解决任务。随后,系统提供一个包含首次运行提示词、评分摘要、输出预览和转录文本的紧凑上下文。智能体从这些证据中总结出可重用的技能,并将其注入到第二次执行的全新环境中。这直接测试了标题中的问题:从已完成的运行中提取程序性记忆。
技术约束与指标
- 隔离性: 每次执行都在隔离的工作空间中进行,以防止状态泄露。
- 变更检查(Mutation Checks): 基准测试在执行前后对技能文件进行哈希校验。如果重用执行修改、添加或删除了技能,则会被标记为
skill_mutation_violation(技能变更违规),以确保实验条件(重用固定技能)得到维持。
- 评分: 任务使用自动化或混合(自动化 + LLM)评分器,通过检查具体的产物(JSON、脚本、报告)而非自然语言答案来进行评分。
- 指标: 基准测试既报告 仅执行(execution-only) 分数(任务成功率),也报告 端到端(end-to-end) 指标(Token 使用量、成本和时间)。效率增益通过基准资源使用量与候选方案使用量的比例来计算。
核心贡献
- 基准构建: EvoClawBench 提供了一个标准化的套件,用于评估智能体是否能从受控的自编写工作流和自身运行证据中学习可重用的技能。它支持多种运行时(目前为 OpenClaw 和 nanobot),并包含固定程序(fixtures)、评分器和脚本。
- 三模式协议: 通过形式化 BASELINE、PRESKILL 和 POSTSKILL 条件,将执行性能与完整工作流带来的开销分离,从而能够检测技能变更违规。
- 实证发现: 论文提供了跨运行时的结果,证明了自编写技能带来的收益既不是自动发生的,也不是单调递增的。
- 开放产物: 基准测试的任务、固定程序、评分器和结果导出功能均已公开。
结果
在 OpenClaw 和 nanobot 运行时下,针对五种模型(GPT-5.4, Qwen3.6-Plus, DeepSeek-V4-Pro, MiniMax-M2.7, GPT-5.4 mini)进行的实验得出以下发现:
- 运行时脚手架至关重要: 性能高度依赖于智能体运行时。在 OpenClaw 下,所有模型的 BASELINE 分数均低于 20%。在 nanobot 下,BASELINE 分数在 56.45% 到 96.13% 之间波动。这表明运行时特定的提示词封装和工具调用显著影响了基准能力。
- 非单调的技能效应: 自编写技能并不保证性能提升。
- nanobot GPT-5.4 在所有模式下均稳定在 96% 以上。
- nanobot MiniMax-M2.7 从 90.97% (BASELINE) 提升至 94.50% (POSTSKILL)。
- nanobot DeepSeek-V4-Pro 遭遇了灾难性的退化,从 77.77% (BASELINE) 跌至 4.80% (PRESKILL) 和 0.99% (POSTSKILL)。
- OpenClaw 显示出类似的混合结果,部分技能运行接近基准,而另一些则出现崩溃。
- 成本敏感性: 即使执行质量得以保持,技能工作流也会产生巨大的开销。端到端 Token 效率比始终低于 1.0(例如,Qwen3.6-Plus 的 PRESKILL 为 0.38,POSTSKILL 为 0.30),这意味着完整的技能工作流比直接执行消耗更多的 Token。
- 技能数量 vs. 质量: 创建的技能数量并不能预测收益。高技能计数与性能提升和性能退化均存在相关性。论文指出,生成的技能的质量和适配度(特别是避免对首次运行上下文的过拟合)比数量更为关键。
- 过拟合风险: 定性分析(图 4)表明,POSTSKILL 总结可能会编码来自首次运行的过于具体的假设(例如特定的文件名或固定程序模式),从而干扰第二个执行环境下的运行。
意义与主张
论文谦虚地主张,从智能体自身的运行中学习可重用技能是具有选择性的且对成本敏感的,而非一种自动获得的收益。
- 并非通用解决方案: 在智能体循环中加入技能编写并不一定会提高性能。结果表明,对于许多模型-运行时组合,编写和总结技能的开销超过了其收益,或者生成的技能会因过拟合而导致性能下降。
- 生命周期聚焦: 该基准测试将评估重点从“智能体能否解决任务?”转向了“智能体能否有效地管理程序性记忆的生命周期(编写、提取、重用和验证)?”
- 未来方向: 作者建议,未来的技能系统必须采用选择性创建策略和重用前的验证。他们还强调,基准测试报告必须包含溯源、变更检查以及端到端的资源成本,以提供对技能效用的现实评估。
论文总结道,虽然程序性记忆是使智能体专业化的一个可行方向,但目前的智能体在处理这一完整生命周期方面尚不够可靠,且必须显式管理成本与质量之间的权衡。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。