← 最新论文
💻 computer science

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

本文介绍了\textsc{TraceToChain},这是一个可复现的流水线,它将大语言模型智能体的执行轨迹建模为吸收式离散时间马尔可夫链,从而将不同的可靠性指标统一为单一的成功时间分布,同时在多个框架下提供严格的统计诊断、不确定性量化和高保真实证验证。

原作者: Phat T. Tran-Truong, Xuan-Bach Le

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Phat T. Tran-Truong, Xuan-Bach Le

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位非常聪明、但偶尔会困惑的机器人助手来解决一个复杂的谜题。你给它一个任务,它开始思考、尝试工具、犯错,然后再次尝试。有时它能解开谜题;有时它会放弃或崩溃。

目前,当我们评估这些 AI 智能体时,通常只是给它们打一个单一的分数,比如"72% 的成功率”。这就像在不知道一辆车是在行驶 10 英里后还是 10,000 英里后才会抛锚,或者引擎的微小改动是否会导致其崩溃的情况下,就说这辆车“可靠”一样。

本文介绍了一种评估这些 AI 智能体的新方法,称为TRACETOCHAIN。它不再给出单一分数,而是构建智能体行为的详细“地图”,以精确预测其在不同条件下的可靠性。

以下是论文如何用简单的类比来解释这一方法:

1. 问题:“单一数字”的陷阱

目前,我们使用简单的数字来衡量 AI 智能体,例如"pass@k"(如果我们让它尝试 5 次,它是否成功?)或“可靠性衰减”(运行时间越长,表现是否越差?)。

  • 类比:想象你是一名飞行员。如果有人告诉你“这架飞机的成功率为 90%",你并不知道这意味着每 10 次飞行就会坠毁一次,还是仅在暴风雨天气下才会坠毁。仅凭这一个数字,你无法回答诸如“如果我添加一个新的导航工具会发生什么?”或“如果我将时间从 10 分钟改为 20 分钟,成功的可能性有多大?”这样的问题。

2. 解决方案:“吸收地图”

作者将智能体的历史(其“轨迹”)转化为一个马尔可夫链

  • 类比:将智能体的旅程想象成一款棋盘游戏。
    • 瞬态状态:这些是智能体仍在工作的“中间”格子(例如“规划”、“调用工具”、“读取错误”)。
    • 吸收状态:这些是“终局”格子。一旦你落在这里,游戏就会停止。只有两个:成功(你赢了!)和失败(游戏结束)。
    • 地图:作者创建了一张地图,显示了从一个格子移动到另一个格子的概率。例如,如果智能体处于“错误”格子,它有 30% 的概率回到“规划”,10% 的概率进入“成功”,60% 的概率崩溃至“失败”。

3. “审计”(检查地图)

你不能只是画一张地图就信任它。本文引入了一套严格的审计流程,以确保地图确实与现实相符。

  • 类比:想象你是一位正在绘制森林地图的制图师。在让徒步者使用地图之前,你需要检查两件事:
    1. 路径是否合理?(论文使用名为AIC的测试,来判断智能体的记忆是否短到可以用简单模型描述,或者是否需要更复杂的地图。)
    2. 地图是否与地形匹配?(论文使用名为KS的测试,来查看预测的路径是否与智能体实际走过的路径相符。)
  • 如果地图未能通过这些测试,作者会说:“停止!不要使用此地图进行预测。”这防止了虚假的信心。

4. 这张地图能让你做什么

一旦地图构建并经过审计,它就成为了解决旧“单一数字”系统无法处理的问题的强大工具:

  • “时间预算”问题:“如果我将智能体的步数从 10 步增加到 50 步,它成功的可能性会增加多少?”
    • 论文主张:地图可以瞬间计算出这一点,而无需再运行智能体 1,000 次。
  • “假设”问题:“如果我们添加一个当智能体卡住时提供帮助的‘回退’工具,会发生什么?”
    • 论文主张:你可以调整地图(改变棋盘上的概率),并立即看到成功率提高了多少,而无需重新运行整个基准测试。
  • “统一”问题:"pass@5"和“可靠性衰减”是不同的事物吗?
    • 论文主张:不!它们只是同一张地图的不同视角。论文从数学上证明,所有这些不同的指标只是从不同角度观察同一个“首达”分布(从起点到成功的路径)。

5. 证明:它有效吗?

作者在七种不同类型的 AI 智能体框架(如 ReAct、Reflexion 和 ToolFormer)上测试了这种方法。

  • 结果:他们将数据一分为二:在一半数据上构建地图,在另一半数据上测试(这部分数据地图从未见过)。
  • 结果:地图以极高的精度(误差约 5% 以内)预测了智能体的成功率。“审计”测试正确地接受了优质地图并拒绝了劣质地图。

总结

论文认为,我们应该停止将 AI 智能体视为抛硬币(正面/反面),而是开始将其视为带有地图的旅程

通过将原始数据转化为经过验证的“吸收马尔可夫链”,我们可以:

  1. 预测随时间推移的成功率。
  2. 测试变更(如新工具),而无需昂贵的重新运行。
  3. 统一令人困惑的指标,形成清晰的图景。
  4. 审计结果,确保我们不是在自欺欺人。

作者强调,这是一个有条件的工具:只有当“地图”通过审计时,它才有效。如果智能体的行为过于混乱而无法适应地图,系统会正确地表示“我们目前无法预测这一点”,而不是给出一个具有误导性的数字。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →