← 最新论文
💻 computer science

ProcBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

本文介绍了 ProcBench,这是一个通过标准化本体论和基于风险的风险评估卡来分析过程级缺陷与控制保持性的框架,用于评估大语言模型编程智能体,其在多个数据集上提供了比传统仅关注结果的基准测试更深入的诊断洞察。

原作者: Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一个机器人助手来修复家中一处复杂的漏水问题。

旧方法(当前基准):
目前,如果你要求机器人修复漏水,你只看结果:水停了吗? 如果水停了,你就给机器人一颗金星;如果水还在滴,你就给它一个拇指向下的评价。

但这忽略了很多故事细节。如果机器人:

  • 在修复漏水前喝光了你的全部供水?
  • 在最终找到水管之前,在墙上同一个洞上戳了 50 次?
  • 中途忘记把工具放在哪里了?
  • 陷入死循环,原地转圈了一个小时才最终成功?

如果水停了,旧系统会说:“干得好!”但在现实中,这个机器人是混乱的、浪费的且难以控制的。

新方法(ProcBench):
这篇论文的作者 ProcBench 表示:“我们需要根据机器人如何完成工作来评分,而不仅仅是看它是否完成了。”

他们建立了一套新的评分系统,像裁判观看足球比赛一样观察机器人的整个旅程,而不仅仅是最终比分。

ProcBench 的工作原理(类比)

将编码代理(机器人)想象成一位厨师,试图烹饪一顿复杂的饭菜。

1. “流程缺陷”(厨房的混乱)
ProcBench 会寻找厨师在流程中可能搞砸的具体方式,即使这顿饭最终味道尚可。他们将这些混乱归纳为四个主要方面:

  • 上下文管理(杂乱的台面):

    • 幽灵上下文: 厨师一直盯着已经总结过的旧食谱页面,浪费着脑力空间。
    • 臃肿的规则: 厨师围裙里揣着一本 50 页的规则手册,其实根本不需要,却拖慢了他们的速度。
    • 反复震荡: 厨师不停地翻冰箱,拿起食材又放下,再拿起,始终无法确定一个计划。
  • 工具使用效率(浪费的动作):

    • 重复步骤: 厨师切洋葱,检查是否切好,再切一次,再检查,再切第三次。
    • 无效步骤: 厨师打开烤箱,往里面看,关上,却从未真正放入蛋糕。动作发生了,但没有任何改变。
    • 冗长链条: 厨师用 50 个微小步骤去做一件本可以用 5 个步骤完成的事。
  • 工作流架构(糟糕的厨房布局):

    • 包装工作流: 厨师有一个助手,只是把盐从厨师的一只手递到另一只手,没有任何实际用处。
    • 上下文耦合: 厨师和副厨师被彼此的任务纠缠得太紧,以至于如果一个人打喷嚏,整个厨房都会崩溃。
  • 工具生态系统一致性(令人困惑的餐具):

    • 不一致的接口: 一把勺子标着“汤”,另一把标着“液体”,第三把标着“汤(热)”。厨师感到困惑并拿错了。
    • 薄弱工具: 抽屉里有一把很棒的电动打蛋器,但厨师从未找到它,因为打蛋器被藏起来了,所以一直用叉子。

2. “控制保持”(安全开关)
这是最重要的一部分。即使机器人犯了错误,(人类)还能接管吗?

  • 可解释性: 你能理解机器人在做什么吗?
  • 可中断性: 你能按下“暂停”而不会导致机器人崩溃吗?
  • 可修正性: 如果机器人犯了错误,你能在不重做整顿饭的情况下修正它吗?
  • 可逆性: 机器人能撤销一个糟糕的步骤吗?
  • 权限移交: 机器人能说“我卡住了,你来接手”,并真正让你接管吗?

“校准记分卡”(成绩单)

ProcBench 不只是说“通过”或“失败”,而是提供一份详细的成绩单。

  • 它不只是计算错误数量;它计算风险
  • 它使用一种“校准”系统(就像天气预报)。它不是说“可能会下雨”,而是说“有 70% 的概率会下雨”。这有助于你理解错误的严重程度。
  • 它给出流程(厨房有多乱)的分数和控制(厨房感觉有多安全)的分数。

他们的发现

作者使用不同的 AI 机器人在 200 个现实世界的编码任务(如修复软件漏洞或构建应用程序)上测试了这套系统。

  1. 它有效: 他们发现可以可靠地识别出这些“厨房混乱”行为。
  2. 它揭示隐藏缺陷: 两个机器人可能都完成了任务(通过),但一个高效且安全,另一个则混乱且充满风险。旧系统会给它们都颁发金星。ProcBench 会给那个混乱的机器人打较低的分数。
  3. 这不仅仅是关于模型: 一个强大的 AI 大脑(模型)并不能保证良好的流程。如果机器人的“身体”(代理框架)笨拙,即使大脑聪明,整个系统也会失败。

核心结论

ProcBench 是一种评估 AI 程序员的新方法。它阻止我们只看最终结果,迫使我们关注整个过程。它问道:“机器人是解决了问题,还是只是在制造混乱和失去控制的情况下,跌跌撞撞地找到了解决方案?”

这有助于开发者构建不仅聪明,而且可靠、安全且易于管理的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →