← 最新论文
💻 computer science

TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows

本文介绍了 TraceCompiler,这是一个技能引导型系统,它通过利用可审计证据严谨地推断工具间的依赖关系,将噪声较大的 LLM 智能体轨迹(traces)编译为具有高度确定性的可执行工作流,从而在保持高精度依赖恢复的同时,显著减少运行时 API 调用。

原作者: Salma El Yadouni (EPFL), Guanyi Li (Binome Technologies)

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Salma El Yadouni (EPFL), Guanyi Li (Binome Technologies)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点丢三落四的机器人管家如何制作你最喜欢的三明治。你演示了一遍制作过程:它拿了面包,然后拿了奶酪,接着拿了刀,然后又拿了一次刀,因为它忘了,接着又去拿了一次奶酪以检查标签,最后才拿了面包。它做出了三明治,但它走过的路径是一段混乱的、由重试、反复检查和在厨房里徘徊组成的“之”字形轨迹。现在,想象你要求机器人做一百次同样的三明治。如果你只是让它通过每次尝试来“学习”,它每次都会为那段混乱的“之”字形路径付出代价,白白浪费能量和时间去重新发现已经知道的步骤。这正是现代使用工具(如检查日历或发送消息)的 AI 智能体(AI agents)所面临的情况。它们在即时解决问题方面非常出色,但它们经常在每一次新的请求中都重复造轮子、重读指令或重试失败的尝试。现在的重大问题是:我们能否将那些混乱、重复的“日记”进行清理,并将它们转化为一套严格、高效的食谱,让 AI 无需每次都费力思考就能遵循?这就是一个机器人每天早上必须重新摸索如何走路,与一个拥有预设“肌肉记忆”来走路之间的区别。

由此,诞生了 TraceCompiler,这是一个旨在成为“厨师”的新系统,负责将那些混乱的机器人日记转化为清晰、可执行的食谱。这项工作的研究人员意识到,虽然 AI 智能体擅长探索,但它们并不擅长记住自己高效的路径。TraceCompiler 扮演着侦探和编辑的双重角色。它观察数百次执行同一任务(例如在 Venmo 上要钱或向播放列表添加歌曲)的嘈杂尝试,并试图弄清楚哪些步骤实际上是必要的,而哪些仅仅是 AI 在原地打转。

TraceCompiler 的核心魔力在于一条关于“因果关系”的严格规则。在一个混乱的日志中,两个动作可能会紧接着发生,但这可能只是巧合,比如机器人先拿面包,然后拿奶酪。TraceCompiler 拒绝假设拿面包这个动作“导致”了拿奶酪。相反,它要求证据:“奶酪是否确实需要一个只有‘拿面包’这一步才能产生的特定信息?”如果答案是否定的,这个连接就会被切断;如果答案是肯定的,且没有其他步骤能提供该信息,则保留这个连接。这使得系统能够剔除掉“噪声”——即重试、偶然的查询和冗余的检查——并留下一个精简的工作流。

结果令人印象深刻,但也伴随着重要的注意事项。在针对旅游相关任务的数据集进行测试时,系统的自动化规则正确识别了步骤之间的必要连接,准确率(precision)约为 93%,召回率(recall)约为 94%。这比那些仅仅观察下一步动作的简单方法(准确率仅为 71% 左右)或仅仅统计步骤共同出现频率的方法有了巨大的飞跃。在一次涉及 Venmo 资金请求的具体测试中,系统成功将一个需要 34 次 API 调用、过程混乱的过程缩减到了仅需 11 次核心调用。这是工作量的大幅减少!

然而,论文非常谨慎地没有声称这是一个完美的、神奇的解决方案。该系统不仅仅是一个随处适用的“黑盒”;它是一个谨慎的编辑。例如,在尝试编译一个“向播放列表添加歌曲”的工作流时,系统碰壁了。它意识到 AI 的日志并没有清晰显示歌曲是在被“添加”还是“删除”,由于这两者是相反且不可逆的操作,系统拒绝了编译。它选择停下来并表示:“我不确定,所以我不会盲目猜测,”而不是冒险删除用户的音乐。这种“拒绝编译”的行为实际上是一个特性而非缺陷,证明了系统优先考虑安全性而非速度。

此外,研究人员也承认,虽然“编译后”的工作流非常高效,但他们并未衡量创建这些工作流本身所花费的时间或成本。这就像是在说“这辆新车油耗很低”,却没告诉你制造这个引擎花了多少钱。他们还发现,虽然该系统在合成数据(计算机生成的示例)上表现良好,但它高度依赖于 AI 识别模式的能力,并且目前还无法完美处理每一种可能的混乱日志。

最终,TraceCompiler 展示了我们可以将 AI 智能体混乱、重复的行为转化为清晰、确定性的程序,但前提是我们必须对什么才算作“证据”保持严苛。这是朝着 AI 不再仅仅是每次都去“摸索”,而是学会遵循一条可靠、高效路径迈出的一步——只要我们能证明这条路径既安全又必要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →