← 最新论文
💻 computer science

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

本文介绍了 Critic Experience Bank,这是一个无需训练、自我进化的框架,它通过利用后验反馈来填充过去经验的记忆库,从而在不需要地面真值标签的情况下,显著提升了 LLM 智能体在步骤级置信度估计方面的校准与排序性能。

原作者: Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款高风险的电子游戏,你的角色是一个 AI 智能体。在这款游戏中,你做的每一个动作——点击按钮、输入命令或轻触屏幕——都会改变周围的世界。如果你走错一步,你可能会陷入死胡同、删除一个关键文件,或者让你的角色陷入一场浪费所有时间的徒劳搜索。可怕的是,直到事情发生之后,你才会知道自己搞砸了。

长期以来,AI 专家试图通过在行动前询问 AI:“你对这个动作有多大把握?”来解决这个问题。但本文指出,这种方法就像是在问一位旅行者:“你确定这条路通向宝藏吗?”却从未让他们看一眼之前其他旅行者留下的地图。AI 可能会因为眼前的路径看起来很美而感到自信,但它根本不知道这条路是否会导致悬崖,因为它没有基于过去的经验进行判断。

问题所在:“失忆症”评论家

作者认为,标准的 AI 置信度检查对于这些交互式智能体来说是失效的。它们是“响应级”的检查,这意味着它们只评判 AI 即将输出的文本,而忽略了采取行动后发生的混乱现实。

这就像一位厨师在端出汤品之前先尝了一下味道,却完全不记得上次加盐时,顾客是赞不绝口还是直接吐了出来。论文表明,当你将这些标准的“味觉测试”应用于复杂的任务(如浏览网页或控制手机)时,AI 的置信度表现得极其不稳定。它经常在应该自信时出错,在应该怀疑时却表现得过于自信。

解决方案:评论家经验库 (Critic Experience Bank, CEB)

为了解决这个问题,研究人员构建了一个被称为评论家经验库 (CEB) 的系统。

想象一下,AI 拥有一个神奇的、自动更新的日记本。它是这样运作的:

  1. 行动: AI 尝试执行某个操作(比如点击“购买”按钮)。
  2. 猜测: 在点击之前,一个“评论家”AI(一个聪明的裁判)观察当前情况并猜测:“我有 80% 的把握这是一个好动作。”
  3. 现实检查: 智能体实际执行了点击。世界发生了变化。它是成功购买了商品?还是导致页面崩溃了?
  4. 事后回顾: 在整个任务完成后,一个“事后 AI”会回顾整个过程。它会说:“嘿,刚才那个‘购买’点击其实奏效了!”或者“不,那是个陷阱。”
  5. 记忆: 这个结果会被记录到经验库中,作为一条微小的笔记:“在类似这种情况下,做那个动作是有效的(或无效的)。”

下次面对类似情况时,评论家不再仅仅是凭直觉猜测。它会翻开日记本,寻找最相似的过往笔记,然后说:“噢,我明白了!上次我们遇到类似情况时,这样做奏效了。但在前一次,它失败了。所以,这次我的信心只有 60%。”

神奇之处在于,评论家 AI 本身并不会改变它的“大脑”(它的权重保持不变)。它不需要被重新训练,它只是通过阅读自己关于成功与失败的过往经历变得更加聪明。

本文排除了哪些可能性

作者非常明确地指出了哪些方法在这里是行不通的。他们明确反对:

  • 仅仅要求 AI “深入思考”(思维链/Chain of Thought): 虽然让 AI 解释其推理过程会有所帮助,但如果 AI 没有关于采取行动后实际发生了什么的记录,这仍然不够。
  • 观察“Token 不确定性”: 这是指检查 AI 内部数学计算的波动程度。论文发现这在这些任务中效果极差。这就像是通过观察司机握方向盘的手是否颤抖来判断驾驶技术,却忽略了他们是否真的击中了目标。
  • 训练新模型: 你不需要花费数周时间从头开始教一个新 AI。这种方法适用于你现有的 AI,只需给它一个记忆库即可。

结果:我们的确定性如何?

研究人员在三种截然不同的“游戏”类型上进行了测试:浏览网页 (Mind2Web)、控制手机 (AMEX) 以及在计算机终端中输入命令 (InterCode-Bash)。他们使用了三种不同的 AI 大脑来驱动这些智能体。

结果表明,CEB 带来了巨大的提升。

  • 校准度 (Calibration): 在 AI 领域,“校准”意味着“置信度数值是否符合现实”。如果 AI 说“90% 确定”,那么它应该在 90% 的情况下是正确的。论文使用 ECE(期望校准误差)来衡量这一点。数值越低越好。
  • 数据表现: 与不需要训练的最佳现有方法相比,CEB 将误差降低了高达 54%。例如,在 Mind2Web 数据集配合特定 AI 模型 (GPT-5.4) 的情况下,误差从 0.319 降至 0.176
  • 排序能力: 它在区分好动作与坏动作方面也表现更好(通过 AUC 衡量,数值越高越好),达到了如 Mind2Web 上 0.704 这样的分数,击败了所有其他方法。

论文还模拟了一个场景:人类(或一个完美的“先知/Oracle”)仅审查 AI 置信度最低的动作。当 AI 使用 CEB 时,整个任务的最终成功率大幅跳升。例如,在 Mind2Web 上,如果允许 AI 将其 3 个最不确定的猜测提交人工审查,成功率会从基础的 2.1% 跳升至 23.7%,这已经非常接近完美“先知”的得分 34.9%

“自我进化”的转折

最酷的部分之一是,这个经验库在初始状态是空的。随着 AI 执行更多任务,经验库会逐渐填满,AI 会变得越来越擅长判断自己的动作。论文指出,随着 AI 积累的经验越多,其置信度的可靠性就越高。这是一个通过积累自身历史记录来学习,而无需人类来批改作业的系统。

简而言之,论文表明,如果你希望 AI 智能体在现实世界中安全且可靠,你不应该仅仅询问它有多确定。你应该给它一份关于过去错误与胜利的日记,这样它才能在有证据支持的情况下,学会信任自己的直觉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →