← 最新论文
🤖 AI

Copy-on-Write Scoring: Application-Specific Agent Evaluations

本文介绍了写时复制(Copy-on-Write, CoW)评分法,这是一种利用 PostgreSQL 级隔离机制在应用程序环境中直接评估基于大语言模型(LLM)的智能体的框架,从而能够以细粒度、低成本的方式识别数据库写入失败,并实现对智能体工具表面的迭代改进。

原作者: Joanna Roy, Sven Hoelzel

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Joanna Roy, Sven Hoelzel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造了一个超级聪明的机器人助手,它可以与你最喜欢的应用程序(比如项目管理工具或日历)进行对话。你希望它能帮你整理生活,但你又非常害怕它可能会不小心删掉你的整个待办事项列表,或者在你老板正在开会时,把他的状态改成“在度假”。这就是 AI Agent(人工智能智能体) 的世界:它们不仅仅是聊天,而是能在软件系统中真正“做事”的计算机程序。目前面临的大问题是如何安全地测试这些机器人。通常情况下,科学家们会在虚构的世界(比如视频游戏模拟器)中测试它们,但这些模拟环境往往会偏离现实,或者构建成本极高,以至于每当真实的应用程序发生变化时,没人能负担得起更新模拟器的费用。我们需要一种方法,既能在真实的应用程序中观察机器人的工作过程,又确保它永远不会造成任何破坏,这样我们就能精准发现它在哪里产生了困惑并加以修复。

于是,一个名为 Copy-on-Write (CoW) Scoring(写时复制评分) 的新想法出现了,由研究员 Joanna Roy 和 Sven Hölzel 提出。你可以把他们的这种方法想象成直接构建在数据库(即应用程序存储数据的数字文件柜)内部的一面“魔幻玻璃墙”。通常情况下,如果你告诉机器人“修改这个文件”,它会直接去修改真实的文件并覆盖原有内容。但在 CoW 机制下,机器人被告知要在覆盖在真实文件之上的一个特殊的、隐形的玻璃片上进行书写。机器人以为自己是在向真实文件写入内容,但实际上它只是在玻璃上书写。原件依然完好无损,未受任何影响。

这里最巧妙的地方在于:系统会保留一个“地面真值”(ground truth)版本,即记录了“应该发生什么”(就像一个完美的真人执行任务的过程),并将此与机器人在玻璃上所做的操作进行对比。因为机器人是在一个独立的层级上进行书写,研究人员可以瞬间发现:“噢,机器人尝试删除了错误的行,”或者“它在错误的任务中添加了评论。”他们可以根据机器人在玻璃上的书写内容与完美人类版本的接近程度,来为机器人的表现评分。如果机器人失败了,研究人员只需擦干净玻璃重新开始即可,无需恢复备份,也不必担心损坏真实数据。

在他们的研究中,团队在 Plane(一个开源项目管理平台)上测试了这一方法。他们设置了 20 个不同的现实任务,例如“将所有未完成的缺陷(bugs)移至‘进行中’列表”或“将新任务分配给特定的团队成员”。他们让五个不同的 AI 模型尝试完成这些工作,同时由 CoW 系统进行观察。结果令人大开眼界。研究人员发现,许多机器人的失败并非因为它们“笨”,而是因为词汇不匹配(vocabulary mismatches)。例如,应用程序称之为“工作项(work items)”,但机器人却在寻找“问题(issues)”。由于找不到正确的词汇,机器人陷入了停滞、放弃了任务,或者开始产生“幻觉”(编造虚假的指令)。

通过使用 CoW Scoring,团队能够精准定位这些失效点。他们意识到:“啊,机器人在这里失败是因为它不知道‘issue’的意思就是‘work item’。”于是,他们更新了机器人使用的工具,使其同时包含这两个词。当他们再次运行测试时,机器人的表现有了显著提升。例如,其中一个名为 Gemini-2.5-Pro 的模型得分提高了 54%,另一个名为 GPT-4.1 的模型得分则跃升了 47%。这项研究表明,这种“玻璃墙”方法是一种强大且低成本的方式,用于在真实应用中调试 AI Agent,帮助开发者修复那些会让机器人感到困惑的具体工具和提示词,而不是仅仅靠猜测问题出在哪里。这是一种让机器人在现实世界中练习,却又无需承担现实世界灾难风险的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →