← 最新论文
🤖 AI

TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

TraceGraph 引入了一种基于图的框架,将多模态智能体轨迹转化为共享决策图谱,以揭示隐藏的导航差异和失败模式,进而实现了一个陷阱感知恢复流水线,显著提升了在 SWE-bench 上的解决率。

原作者: Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察五名不同的探险家试图破解一个复杂的迷宫。在过去,如果你想知道谁是最优秀的探险家,你只需看最终得分:“他们到达出口了吗?是或否?”

TraceGraph 这篇论文指出,这种“是或否”的评分隐藏了太多信息。这就像评价一位厨师时,只看蛋糕是否被吃掉了,却忽略了一个厨师为了吃到蛋糕甚至烧毁了厨房,而另一个厨师则是沿着花园走了一条风景优美的路径。

以下是 TraceGraph 的工作原理,通过简单的解释说明:

1. 共享地图(决策图景)

TraceGraph 并不是孤立地观察每个探险家的路径,而是将他们所有的步骤合并到一张巨大的、共享的地图上。

  • 步骤: 每当一个 AI 智能体(探险家)采取一个动作(例如“读取文件”或“运行测试”)并看到结果时,它都会留下一个“足迹”。
  • 聚类: TraceGraph 会观察这些足迹。如果两个步骤看起来非常相似(例如,两者都在尝试修复同一个文件中的特定错误),它就会画一条线将它们连接起来。
  • 结果: 这创造了一个任务的网状结构或“图景”。有些区域是安全的且通向成功;而有些区域则是死胡同。

2. 三个关键事件

一旦构建好地图,TraceGraph 就会观察 AI 如何在上面移动。它现在还不关心最终得分,它关心的是三个特定的时刻

  1. 接入(Access): AI 是否找到了“生产性核心”?(即那个安全、高价值的、能进行有效工作的区域)。
  2. 陷阱暴露(Trap Exposure): AI 是否误入了“陷阱”?(即一个许多人曾在此失败或陷入困境的混乱区域)。
  3. 修复(Repair): 如果 AI 掉入了陷阱,它是否设法爬了出来并回到了生产性核心?

3. 地图揭示了什么

当研究人员观察这张共享地图时,他们发现了简单评分所遗漏的东西:

  • 不同的风格: 一些模型(如 DeepSeek-V3.2)是勇敢的探险家。它们经常找到生产性核心,有时会掉入陷阱,但非常擅长爬出来(修复)。其他的模型(如 Qwen3-Next)则非常谨慎。它们很少掉入陷阱,但因为过于胆小,也很少能找到生产性核心。
  • 不同的迷宫有不同的规则: 研究人员在五种不同类型的任务(如修复软件漏洞、搜索网络或使用工具)上进行了测试。他们发现,有些迷宫奖励的是规避陷阱(不要犯错!),而另一些迷宫(如修复软件漏洞)则奖励从错误中恢复的能力。一个擅长规避陷阱的模型,在需要具备从错误中恢复能力的任务中,可能会表现不佳。

4. “陷阱检测器”实验

最令人兴奋的部分是他们如何利用这张地图来实时帮助 AI。

  • 想法: 由于他们准确知道在地图上什么样的模式代表“陷阱”(即特定的动作和错误模式),他们构建了一个检测器
  • 触发: 当一个 AI 在解决新问题并踏入一个与已知“陷阱”相匹配的模式时,检测器就会发出警报。
  • 救援: 当警报响起时,系统并不会任由 AI 继续失败。它会暂停并尝试两种简单的修复方法:
    1. “热”修复(Hot Fix): 它告诉 AI 尝试以更高的随机性(就像摇晃骰子一样)再次尝试,看看是否有不同的路径可行。
    2. “提示”修复(Note Fix): 它根据错误给 AI 一个温和的提醒笔记:“嘿,你似乎卡在这里了。重新阅读错误信息,专注于这个特定文件,并尝试进行一次微小的改动。”

结果: 在一项软件修复任务(SWE-bench)中,使用这个陷阱检测器帮助 AI 多修复了大约 3 到 4% 的问题。这证明了了解陷阱在哪里,可以让你构建一个安全网,在 AI 失败之前捕捉到它并给予它第二次机会去修复。

总结

TraceGraph 是一个让我们不再仅仅关注 AI 最终得分的工具。相反,它构建了一张关于 AI 智能体如何在任务中移动的共享地图。它向我们展示了:

  • 哪些模型是勇敢的探险家,哪些是谨慎的步行者。
  • 哪些任务需要规避错误,哪些需要从错误中恢复。
  • 如何构建一个简单的“安全网”,在 AI 即将掉入已知陷阱时检测到它,并给它第二次机会去修复。

它将“AI 失败了”这个黑盒过程变成了一个清晰的故事:“AI 掉进了陷阱,但只要给予一点点帮助,它本可以爬出来的。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →