← 最新论文
🤖 AI

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

这项定性初步研究表明,代理型人工智能模型在遇到不一致与不完整的工具响应时,其对数概率表现出截然不同的、具有特定通道特征的签名,这揭示了针对这些不同故障类型的鲁棒性具有不对称性,且需要定制化的检测机制而非通用方法。

原作者: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的版图中,一种新型的数字员工——语言智能体(language agent)——已经出现。与以往仅根据静态数据库回答问题的程序不同,这些智能体旨在执行任务。它们可以浏览网页、查询数据库并使用软件工具来解决复杂问题,就像一个人类助手拿起电话拨打预订电话或检查电子表格中的库存一样。然而,这些数字员工并非无懈可击。当它们调用工具时,期望得到清晰、准确的响应。但在现实世界中,工具有时会失效,返回错误消息,或者返回看似完美实则包含微妙谎言的数据。研究人员面临的核心挑战不仅在于构建那些在一切顺利时能正常工作的智能体,还在于构建那些能够识别出错情况并做出恰当反应的智能体。如果一个智能体无法区分工具是损坏了还是在误导它,它就会应用错误的修复方案,从而可能浪费时间或使情况变得更糟。

来自奥尔堡大学和浙江大学的一个研究小组致力于调查这一精确的决策时刻。他们想知道人工智能是否能瞬间区分一个未能返回任何数据的工具和一个返回了格式正确但内容虚假答案的工具。为了测试这一点,他们创建了一个模拟零售客户服务场景的受控环境。在这个数字世界中,智能体扮演支持代表的角色,使用十六种不同的工具来查询订单详情、检查支付方式并更新用户信息。研究人员选取了一个标准的、成功的动作序列,并在特定点将工具的正常响应替换为故障响应。他们创建了三种类型的故障:一种是工具返回错误消息导致的完全失效;一种是伪造的订单状态,它改变了智能体下一步被允许执行的操作规则;另一种是伪造的支付标识符,它看起来很正确但不属于该客户。

研究人员并不仅仅是观察智能体尝试完成任务并看它是否成功。相反,他们在故障数据到达的瞬间暂停了过程。他们检查了模型的内部“思考过程”,特别是观察其生成下一个词的可能性。他们测量了两个截然不同的指标。首先,他们检查了返回的数据是否符合工具本身的预期格式。其次,他们检查了该数据与智能体在对话中已看到的所有信息(包括用户的原始请求和之前的工具结果)的契合程度。他们还观察了智能体针对紧接着的下一步所制定的计划,测量了它对采取何种行动的信心程度,以及该行动是否涉及再次检查系统状态或继续推进变更。

结果显示,智能体对这些不同类型错误的反应存在显著且即时的差异。当工具返回一条损坏的错误消息时,智能体会立即识别出数据不符合工具的基本格式。这是一个明确的信号,表明工具失效了。因此,智能体的计划发生了剧变;它极有可能选择一个重新读取系统状态的动作,本质上是决定重试或核实事实。相比之下,当工具返回一个格式正确但虚假答案时,智能体并未发现格式上的问题。数据看起来非常完美。然而,智能体将新数据与对话历史进行内部对比时发现了冲突。虚假的数据与用户之前陈述的内容或系统政策产生了冲突。

至关重要的是,研究人员发现智能体对这些错误答案的反应完全取决于谎言的性质。当伪造的信息是一个简单的错配(例如一个不属于用户的支付 ID)时,智能体的计划基本保持不变。它既没有变得困惑或不确定,也没有产生疑虑,而是直接接受了虚假数据并继续操作,因为这个谎言并没有改变交互的基本规则。但当伪造的信息是一个改变了允许执行操作规则的订单状态时,智能体的行为发生了转变。它对下一步该做什么变得不确定,并且它的计划也随之改变,以反映出那个新的、错误的现实。这表明,智能体可以区分工具是损坏了还是在撒谎,但它并不总能区分一个无害的谎言与一个会导致任务脱轨的有后果的谎言。

研究还观察了在初始错误发生后会发生什么。研究人员发现,错误的类型会在智能体未来的行为中留下持久的痕迹。损坏的工具导致智能体在后续步骤中不断尝试重新读取系统状态,这是陷入验证循环的表现。然而,伪造的订单状态却将智能体引向了完全不同的路径,导致它基于错误信息采取了改变系统状态的行动。而对于最初被智能体毫无问题地接受的伪造支付 ID,它在后续步骤中也持续被接受,没有任何迹象表明智能体意识到自己被误导了。这证明了智能体识别错误的能力并非单一、通用的警报。相反,它是一系列不同的信号。一个信号告诉智能体工具损坏了,另一个信号告诉它数据与过去的信息不一致,第三个信号则告诉它数据与规则不一致。没有任何单一信号能捕捉到所有类型的错误。

研究人员得出结论,这些智能体的鲁棒性不在于拥有一个能标记所有坏数据的单一指标。相反,它需要同时读取多个渠道的信息。智能体必须能够察觉到数据何时未能匹配工具的形态,何时与对话历史相矛盾,以及何时与领域规则相矛盾。研究表明,这些不同类型的错误会在智能体的内部计算中产生独特的特征。损坏的工具是显而易见的,因为它破坏了格式。撒谎的工具更难捕捉,因为它符合格式却破坏了逻辑链条。最危险的谎言是那些改变游戏规则的谎言,因为它们可以将智能体引向完全错误的路径而不触发任何困惑。通过理解这些特定的特征,开发者可以构建出更擅长诊断自身错误并选择正确补救措施(无论是重试工具、交叉核实事实,还是停下来寻求澄清)的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →