← 最新论文
🤖 AI

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

本文介绍了 RUPA,这是一个轨迹级不确定性量化框架,它将执行历史建模为有向图,以在关系依赖中传播不确定性,从而在检测长程误差累积方面优于现有方法,并提高大语言模型智能体在复杂交互环境中的可靠性。

原作者: Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,新一代软件已经涌现,它们不仅仅是回答问题或编写文本。这些被称为“自主智能体”(autonomous agents)的系统被设计为能够独立行动。它们可以将一个复杂的任务分解为更小的步骤,利用数字工具收集信息,并与计算机环境交互,以解决需要做出数十个甚至数百个决策的问题。可以将它们想象成能够浏览互联网、编写代码或管理数据,且无需人类持续监督的“数字员工”。然而,随着这些智能体承担起更加艰巨的任务,一个关键问题随之而来:我们如何知道它们是否即将犯错?与可能只产生一个错误句子的简单文本生成器不同,智能体的失败往往是一个缓慢的过程。在一个长链条推理过程中早期产生的微小错误可能会向后传播,扭曲后续步骤,并导致最终结果的彻底崩溃。为了让这些系统在现实世界中获得信任,开发者需要一种能够在错误发生时(而非事后)衡量失败风险的方法。

长期以来,研究人员一直试图构建能够识别模型何时感到不确定的系统。传统方法通常观察计算机的即时输出,检查模型对即将生成的下一个词表现出的自信程度。这种方法对于短期任务效果良好,但在任务跨越长时间线时则会失效。问题在于,这些方法将每一步都视为孤立的事件,忽略了智能体到达当前状态的历史过程。它们错失了十步之前做出的决策与当前行动之间微妙的联系。如果智能体在开始阶段误解了用户的请求,这种最初的困惑在当时可能看起来并不像是一个错误,但它可能会导致整个项目在后期偏离轨道。现有的工具就像一位只盯着汽车正前方的路面看的司机,却忽略了由于几英里前的一次错误转弯,最终将导致驶入死胡同的事实。

为了解决这个问题,来自中国科学院的一个研究小组开发了一个名为 RUPA 的新框架。该框架不再将智能体的工作视为简单的步骤列表,而是将整个过程映射为一个相互连接的事件网络。在这个系统中,每一次行动、工具的使用以及每一条反馈都是图中的一个节点,而连接它们的线条则代表了它们之间的逻辑关系。研究人员发现,错误往往沿着这些特定的连接进行传播。通过构建这样一张地图,系统可以追踪不确定性是如何在智能体的历史记录中增长和移动的。它通过不仅观察模型的即时置信度,还观察通往当前时刻的路径可靠性,来计算当前时刻的风险评分。如果早期的步骤不够稳固,即使当前步骤本身看起来很自信,系统也会意识到当前的步骤是建立在脆弱的基础之上的。

该团队在各种具有挑战性的任务上测试了这种方法,包括复杂的软件工程问题、基于终端的计算挑战以及开放式的解题场景。他们使用六种不同的语言大模型进行了这些测试,涵盖了从小型到大型的各类系统。结果表明,这种新方法在发现问题方面明显优于现有技术。在一组测试中,新系统在检测失败的能力上比以往最好的方法有了显著的提升。更重要的是,它能在过程中更早地识别出潜在的失败。旧的方法往往直到接近尾声时才意识到出了问题,而这种新方法可以在仅仅经过几步之后就发出危险信号,从而让系统有机会在任务被破坏之前纠正航向。

研究人员还展示了这种对风险更好的理解可以如何用于提升智能体的表现。当系统在几种可能的行动中进行选择时,它可以利用风险评分来挑选最安全的选项。在这些试验中,由这种新方法引导的智能体比由传统置信度度量引导的智能体完成了更多的任务。这项研究表明,实现可靠人工智能的关键不仅在于观察当下,还在于理解旅程的结构。通过绘制智能体所采取的每一步之间的关系图,我们可以看到微小的确定性是如何累积成重大问题的。这种方法提供了一种切实可行的方式,来构建不仅具备能力而且值得信赖的智能体,使其能够在复杂的环境中导航而不至于迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →