← 最新论文
🤖 AI

AgentTrails: Towards Trust and Reuse for Agentic Tasks

AgentTrails 是一个原型系统,它将由大语言模型驱动的智能体(LLM-powered agents)的原始时间序列日志转化为结构化的溯源图,通过揭示隐藏的数据依赖关系、实现执行对比并支持模式提取与技能抽象,来增强信任度与复用性。

原作者: Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位才华横溢但略显混乱的大厨烹饪一道复杂的菜肴。你可以看到大厨抓取食材、切菜、搅拌和摆盘,但你看到的只是一段大厨手部左右移动的视频。你知道发生了什么,但你不知道为什么大厨在拿了胡椒之后又拿了盐,也不知道他们在第三步制作的酱汁是否真的用在了最后的菜肴中,或者他们是否只是做了一整批没人吃的额外汤品。在人工智能的世界里,这些“大厨”被称为 LLM 驱动的智能体(LLM-powered agents)。它们是能够通过使用工具(比如搜索网络、运行代码或读取文件)来解决难题的计算机程序,就像人类一样。

当这些智能体工作时,它们会留下一个冗长、杂乱的列表,记录下它们所做的每一件事,并按顺序排列。这被称为轨迹(trajectory)。把它想象成一篇日记,上面写着:“首先我做了这个,然后我做了那个,接着我又做了这个其他动作。”问题在于,虽然这篇日记告诉了你事件的顺序,却隐藏了真正的故事:即连接下一步骤与上一步骤之间的那些隐形线索。很难看出哪一步依赖于前一步,或者智能体是否因为产生了困惑而走错了路。如果看不见这些联系,就几乎不可能修复错误、从优秀的案例中学习,或者信任智能体确实正确完成了它的工作。

这就是名为 AgentTrails 的新项目发挥作用的地方。来自纽约大学的研究团队意识到,仅仅阅读按时间顺序排列的日记是不够的。他们想要将那份杂乱的列表变成一张清晰的视觉地图。他们的目标是构建一个系统,该系统能够观察一段原始、枯燥的智能体动作日志,并自动重建隐藏的“家族树”依赖关系。他们想要展示清楚:哪次工具调用生成了特定的文件,哪个文件随后被用作下一步骤的“原料”,以及智能体是在哪里偏离了航道。

论文介绍了 AgentTrails,这是一个原型系统,充当了这些 AI 智能体的侦探。它不仅仅是展示一个事件列表,而是将原始文本日志转化为一个溯源图(provenance graph)。想象一下,将那段混乱的厨房视频转化为一个流程图,其中每个食材都是一个节点,而每个烹饪步骤则是连接它们的箭头。这让隐形的依赖关系变得可见。该系统并不只是靠猜测;它会在文本中寻找线索,例如在一步骤中出现并在后续步骤中被引用的文件名、ID 或特定数值,从而绘制出它们之间的连线。

但神奇之处并不止于单个智能体。研究人员还解决了比较不同智能体,或同一智能体多次执行同一任务的问题。由于 AI 有点像人类,它可能会以略微不同的顺序解决同一个谜题,或者一次走弯路,另一次走捷径。AgentTrails 可以获取多个这样的“地图”,并将它们缝合在一起,形成一个并集商图(joined quotient graph)。可以将这想象成将多条不同的登山路径叠加在同一座山上。系统会高亮显示所有人使用的主要路径(共同的、成功的流程),并展示出某些人在哪里迷失了方向或绕了不必要的远路。这有助于开发者发现隐藏在逐一查看日志背后的“最佳实践”和“坏习惯”。

团队在现实世界的案例中测试了这个系统。在一个场景中,他们观察了一个试图解决关于氢原子物理问题的智能体。原始日志只是一长串数字和工具调用,但 AgentTrails 揭示了一个清晰的模式:智能体计算了几个独立的常数,将它们结合起来找到一个特定值,然后利用该值计算出最终答案。在另一个测试中,他们分析了一个探索基因数据的智能体。通过对比一个“高分”(成功)的运行过程与一个“低分”(失败)的运行过程,并集图显示,成功的智能体遵循了一条直接的路径,而失败的那个则不断进行不必要的侧向尝试,并进行了许多对结果毫无帮助的额外工具调用。

论文指出,这种方法是让 AI 智能体更可靠、更容易调试的一个充满前景的步骤。然而,作者也谨慎地指出,这仍属于初步工作。他们尚未证明其系统能够完美找到每一个连接,并且仍在研究如何扩展规模以处理成千上万个复杂的任务。他们通过人工标注的一组小样本展示了其有效性,但关于如何在更大规模上自动验证这些地图的问题仍然悬而未决。

最终,AgentTrails 提供了一种观察 AI 的新方式。与其将这些智能体视为只会吐出答案的“黑盒”,它试图打开盒子,展示内部运转的齿轮。通过将简单的线性时间轴转变为丰富的、互联的地图,它为开发者提供了理解、比较和改进数字智能体思考与工作方式的工具。这标志着从仅仅观看表演,转向理解幕后的剧本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →