CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
本文介绍了 CalibForge,这是一个通过使用对抗性求解器校准来识别“可学习区域”(即任务既可解又具挑战性的区域)从而合成有效终端训练任务的自主系统,与传统的训练数据策展方法相比,该系统在多个智能体基准测试中实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人在数字车间里修理东西。你给了它一个工具箱和一份工作清单,但有一个陷阱:如果任务太简单,机器人会感到无聊且学不到任何东西;如果任务太难,机器人会立即放弃且学不到任何东西。学习的“黄金分割点”是一个“金发姑娘原则”(Goldilocks)式的挑战——即机器人如果真的努力思考就能解决,但如果注意力不集中或感到困惑就会失败。这正是训练 AI 智能体(Agent)的核心难题:如何创建一个庞大的任务库,使其完美地调校在这一学习区间内?
长期以来,研究人员一直试图通过确保任务是“可执行的”并且拥有明确的正误答案来构建这些任务库。但仅仅因为一个任务“可以”被完成,并不意味着它是一个好的老师。一个任务可能过于简单,以至于任何机器人都能瞬间解决;或者由于设计缺陷而无法被任何机器人解决。核心问题在于:我们如何找到那些足以让机器人变得更聪明的任务?
这就是名为 CalibForge 的新系统发挥作用的地方。你可以把 CalкаForge 想象成一个调皮的游戏主持人,它在与机器人进行“对抗性”游戏。它不仅仅是检查一个任务是否可行,而是雇佣了一个由不同“求解器”(Solver)机器人组成的团队(有些很聪明,有些则稍逊一筹)来尝试该任务。如果聪明的机器人解决了问题,而笨的机器人失败了,那么这个任务就是完美的——它处于学习区间!如果所有人都解决了,说明任务太容易了,CalibForge 会让它变得更难;如果所有人都失败了,说明任务有缺陷,CalibForge 会修复它。通过根据这些不同机器人的反应不断微调任务,CalibForge 构建了一个包含 5,431 个完美校准挑战的庞大库。当新的机器人使用这个库进行训练时,它们解决现实世界计算机问题的能力显著提升,这证明了“金发姑娘”区间正是教学的秘诀。
问题所在:太容易、太难,还是刚刚好?
在人工智能领域,特别是对于“终端智能体”(即通过在计算机终端输入命令来修复代码或管理服务器的机器人)而言,研究人员一直在构建庞大的练习题库。目标是训练这些智能体处理复杂的现实世界工程任务。然而,这些问题的制作方式存在缺陷。
大多数系统只检查两件事:
- 能否完成?(计算机环境是否设置正确?)
- 是否有正确答案?(任务是否具有明确的通过/失败测试?)
但这就像给学生做数学测试,题目要么是“2+2 等于几?”(太简单),要么是“解出这个尚未被发明的方程”(不可能)。两者都无法帮助学生学习。论文指出,我们需要的是相对于求解器的可学习任务(solver-relative learnable)。这意味着一个任务应该能被一个有能力的智能体解决,但不能被一个较弱的智能体解决。它需要恰好处于智能体能力的边缘,迫使它通过“压榨大脑”来取得成功。
解决方案:对抗性游戏主持人
作者创建了 CalibForge,这是一个自主系统,扮演着一个不知疲倦的游戏主持人。它不仅编写任务,还通过一种称为**对抗性求解器校准(Adversarial Solver Calibration)**的过程来“校准”任务。
以下是其运作过程的详细步骤:
- 线索: CalibForge 从一个模糊的想法开始,例如“修复损坏的数据库”或“恢复丢失的数据”。
- 草拟: 一个“作者智能体”(一个聪明的 AI)编写一个完整的任务,包括指令、虚拟计算机环境以及用于检测任务是否完成的测试。
- 压力测试: 在任务被保留之前,CalibForge 会将其发送给一组“求解器智能体”进行尝试。
- 校准循环: 这是核心秘诀。CalibForge 使用两种特定的策略来决定一个任务是否足够好:
- 多求解器校准(Multi-Solver Calibration): 它将任务发送给一组不同的 AI 模型。如果所有人都解决了,说明任务太容易,因此 CalibForge 会使其变得更难。如果没有人解决,说明任务有缺陷,因此 CalibForge 会修复它。只有当存在分歧时(至少有一个求解器成功,同时至少有一个求解器失败),任务才会被保留。这证明了任务处于“学习区间”。
- 对比校准(Contrastive Calibration): 它将任务发送给一个“强求解器”(非常聪明的 AI)和一个“弱求解器”(能力较弱的 AI)。只有当强求解器通过而弱求解器失败时,任务才会被保留。这确保了任务既有足够的难度来挑战强者,又不至于难到完全无法完成。
如果一个任务不符合这些严格的标准,CalibForge 不会直接丢弃它。它会观察求解器失败或成功的原因,然后返回去重写指令、环境或测试。它会重复这个循环,最多进行 50 次,直到任务被完美校准。
结果:完美的挑战库
通过这种方法,CalibForge 构建了一个包含 5,431 个高度校准的终端任务的数据集。研究人员随后使用该数据训练了两个不同的 AI 模型(一个 300 亿参数模型和一个 350 亿参数模型)。
结果令人印象深刻。在 CalibForge 任务上训练的模型在 Terminal-Bench 2.0(针对终端智能体的标准测试)上的得分分别为 32.58% 和 47.57%,大幅超越了之前的最佳结果。
这种改进不仅限于训练数据。在测试完全不同的现实世界软件工程挑战(SWE-bench Pro 和 Doc2Repo)时,这些模型表现出了巨大的增益,分别比其基础版本提高了 27.68 和 30.04 个百分点。
为什么这很重要
论文表明,构建更好 AI 智能体的关键不在于给它们更多的数据,而在于给它们正确类型的数据。通过利用不同求解器的行为作为反馈循环,CalibForge 确保了库中的每一个任务都是真正的学习机会。
作者明确指出,仅仅增加更多的求解器反馈或使用单个求解器来检查任务是不够的。这种“金发姑娘”效应——即任务对某些人很难,但对其他人来说很容易——才是驱动学习的动力。这种方法将任务创建过程从静态的“编写并期待”转变为动态的、自我修正的系统,该系统主动寻找完美的难度水平。
简而言之,CalibForge 证明了,如果你想训练一个超级聪明的机器人,你不应该只给它一堆作业,而应该给它一堆经过完美调校、能促使它思考、挣扎并最终获得成功的作业。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。