Learning Correct Behavior from Examples: Validating Sequential Execution in Autonomous Agents
本文提出了一种新颖算法,该算法通过仅从 2 至 10 条执行轨迹中学习泛化的真实模型,利用支配者分析和多模态大语言模型,在跨领域的缺陷检测与可解释验证中实现高精度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但略显混乱的机器人助手如何煮一杯咖啡。
在过去,如果你想检查机器人是否做对了,你就必须编写一本严格的规则手册:“首先,拿起马克杯。然后,按下按钮。接着,精确等待 3 秒。最后,倒出咖啡。”如果机器人拿起了杯子,按下了按钮,并且因为那天机器速度更快而在 2 秒后就倒出了咖啡,你那本严格的规则手册就会尖叫:"错误!你没有等待 3 秒!"并判定机器人失败,尽管咖啡完美无缺。
这就是测试现代 AI 智能体所面临的问题。它们很灵活。有时它们会走捷径;有时它们会等待更久。即使它们正确完成了工作,也不会每次都遵循完全相同的路径。
这篇论文介绍了一种测试这些智能体的新方法,它不像一本严格的规则手册,而更像一位聪明的导师。
核心理念:从“好日子”中学习
与其编写规则,不如让系统要求智能体成功执行任务2 到 10 次。系统会观察这些“好日子”,并构建一张心理地图,区分什么是必须发生的,什么是可以变化的。
这就像观察一群朋友穿越城市前往一家特定的餐厅:
- 朋友 A 乘坐地铁,在主要车站下车,穿过公园,然后到达。
- 朋友 B 乘坐公交车,在两个街区外下车,经过一家面包店,然后到达。
- 朋友 C 乘坐地铁,在主要车站下车,穿过公园,但在到达前停下来系了一下鞋带。
严格的测试者会说:“朋友 B 失败了,因为他没坐地铁!”或者“朋友 C 失败了,因为他停下来了!”
但这个新系统更聪明。它观察这三条路径并意识到:
- 必经站点(“支配”树): 每个人都必须从家出发,并且必须到达餐厅。这些是不可协商的检查点。
- 可选站点: 公园、面包店和系鞋带只是变体。它们有也不错,但不是必需的。
它是如何工作的(三个步骤)
1. “相册”(捕捉轨迹)
系统截取智能体正确执行任务几次的屏幕截图(或记录操作)。它将这些转化为流程图,就像一本“选择你自己的冒险”书,其中记录了每一条成功的路径。
2. “智能合并”(发现模式)
这是神奇的部分。系统使用两种工具来确定什么才是重要的:
- “眼睛”(视觉指标): 它查看截图。如果两个屏幕 99% 相同,它就将其视为同一步骤。
- “大脑”(LLM 分析): 有时屏幕看起来不同但含义相同(例如,窗口稍微大了一点,或者时钟上的时间变了)。系统会询问一个强大的人工智能语言模型:“这些差异重要吗,还是只是表面现象?”如果 AI 回答“不,这只是字体不同”,系统就会忽略它。
通过合并这些路径,系统构建了一个**“支配树”**。这是一个简化的地图,只显示每一次成功尝试都必须经过的关键里程碑。它过滤掉了噪音(例如,有时出现但有时不出现的加载屏幕)。
3. “检查清单”(验证新运行)
当智能体再次尝试任务时,系统不会检查它是否遵循了完全相同的路径。相反,它会问:“你是否按正确的顺序到达了所有关键里程碑?”
- 如果智能体跳过了“主窗口”直接去了“结果”,系统会说,“失败”。(你错过了一个关键站点)。
- 如果智能体跳过了“加载屏幕”(这是可选的),系统会说,“通过”。(你高效地完成了工作)。
为什么这很重要
该论文在一个必须打开代码编辑器并搜索文本的计算机智能体上测试了这种方法。
- 旧方法(自我报告): 智能体经常说“我做到了!”即使它失败了,或者说“我失败了!”即使它实际上成功了,因为它被计时问题搞糊涂了。它的准确率只有约 82%。
- 新方法: 通过利用仅从3个成功示例中学到的“支配树”,系统实现了100% 的准确率。它能够区分智能体何时实际上破坏了软件(产品缺陷),以及何时智能体仅仅因为网络连接缓慢而 stumble(智能体问题)。
总结
这篇论文提出了一种工具,教会 AI 如何给自己评分。它不需要成千上万的示例或僵硬的规则手册,而是从 handful(少量)的好示例中学习正确任务的“骨架”。它理解,虽然旅程可能各不相同,但目的地和关键地标必须保持不变。这使得测试自主智能体更加可靠,且不易产生误报。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。