← 最新论文
🤖 AI

Structured Feedback Improves Repair in an LLM Agent Loop

本文介绍了 VeriHarness,这是一种代码控制的智能体循环,它证明了向大语言模型提供包含失败位置、观测值和可容许替代方案的结构化反馈,相比于原始诊断或不完整的反馈,能显著提高迭代任务中的修复成功率。

原作者: Jaideep Ray, Ankit Goyal

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaideep Ray, Ankit Goyal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点过于死板的机器人玩电子游戏。你给机器人一个目标,比如“寻找宝藏”,然后它开始在世界中移动。有时,机器人会犯错——也许它试图打开一扇已经打开的门,或者试图捡起一个并不存在的物品。在人工智能的世界里,这个机器人被称为“LLM智能体(LLM agent)”,而负责检查机器人的动作是否合法的那个部分被称为“校验器(validator)”。

长期以来,当机器人出错时,校验器只会说:“不对,错了,”然后让机器人再试一次。这就像一个老师说:“再试一次吧,”却不告诉学生为什么答错了,或者正确答案应该是怎样的。机器人只会不断地猜测,希望能碰巧成功。但如果校验器能更有帮助呢?如果它能精确地指出错误在哪里,展示机器人实际做了什么,甚至还能提供一份它本可以采取的操作建议列表呢?这篇论文提出了一个简单但强大的问题:给予机器人一个包含详细信息的“修复工具包”,是否比仅仅得到一个简单的“再试一次”的消息能让它更快、更好地修复错误?

研究人员构建了一个特殊的测试场,叫做 VeriHarness。把它想象成一个视频游戏关卡,一个严格的裁判(校验器)在观察机器人(AI模型)进行游戏。如果机器人做出了错误的动作,裁判就会停止游戏并递给机器人一张便条。团队想看看什么样的便条效果最好。他们测试了四种不同类型的便条:

  1. 原始便条(The Raw Note): 只有错误信息,例如“指令 1 无效”。
  2. 散文便条(The Prose Note): 一段友好的文字,解释错误发生在哪里,机器人看到了什么,以及它应该做什么。
  3. 结构化便条(The Structured Note): 与散文便条包含相同的信息,但格式化为带有标签的技术列表(类似于 JSON 文件)。
  4. “仅位置”便条(The "Location Only" Note): 告诉机器人它在哪里出错以及它看到了什么,但没有建议任何替代方案。

他们用两个不同的 AI 模型(一个叫 Qwen,一个叫 Llama)在文本冒险游戏中进行了 50 次实验。目标是看机器人能否在四次尝试限制内达到终点(赢得游戏)。

结果让“原始便条”派大跌眼镜。当机器人获得包含错误发生位置观察到的情况以及可选替代方案列表(即可以进行的有效动作)的详细便条时,它成为了冠军。

  • 对于 Qwen 模型,成功率从 28%(使用原始错误信息时)跃升至 72%(使用详细便条时)。这是 44 个百分点的提升。
  • 对于 Llama 模型,成功率从 16% 跳升至 58%,提升了 42 个百分点

这一发现最令人兴奋的部分在于其背后的原因。研究人员曾怀疑,也许是因为机器人喜欢“结构化便条”(那种带有技术标签的格式)整洁有序的外观。但他们通过对比“散文便条”(纯英文段落)和“结构化便条”进行了测试。结果显示,两者的表现几乎完全一样。无论是用友好的段落还是技术列表来编写建议,其实并无大碍。真正的魔力不在于格式,而在于内容

具体来说,“仅位置”便条(它只告诉机器人哪里失败了,但没提供新思路)几乎没有任何帮助。它的成功率仍然接近于原始错误消息的低水平。这证明了仅仅指出错误是不够的;机器人需要被递上一份可供选择的有效选项列表。这就像一位老师说“你把 'cat' 写错了”,对比的是“你把 'cat' 写错了,你可以写成 'bat'、'hat' 或 'mat'”。

该研究还检查了这种技巧是否适用于编程任务(使用名为 HumanEval 的问题集)。他们发现,这种方法只有在校验器能够“看见”错误时才有效。如果机器人通过了一个可见的测试,却在一个校验器看不见的隐藏测试中失败了,那么再多的反馈也无法修复它。这表明,虽然详细的反馈是一种超能力,但它并不是魔法——它只能修复它所能看到的东西。

最后,这篇论文建议,如果我们希望我们的 AI 智能体更好地修复自己的错误,我们不应该只是让它们重新猜测。我们需要构建像“教练”一样的校验器:指出具体的错误,展示实际发生了什么,并提供一个接下来可以尝试的正确选项菜单。事实证明,对于 AI 来说,一点点具体的、具有行动指导意义的建议,远比一千句“再试一次”更有价值。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →