← 最新论文
🤖 machine learning

ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning

本文介绍了 ATLAS,这是一个结合了轨迹抽象与自动机学习的新型框架,旨在将不透明的基于大语言模型(LLM)的智能体轨迹转化为可解释的有限状态模型,从而实现对复杂任务(如网络安全)中智能体策略的系统性分析、可解释性以及知识迁移。

原作者: Ignacio D. Lopez-Miguel, Andreas Happe, Jürgen Cito, Ezio Bartocci, Bettina Könighofer, Martin Tappler

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ignacio D. Lopez-Miguel, Andreas Happe, Jürgen Cito, Ezio Bartocci, Bettina Könighofer, Martin Tappler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位才华横溢但神秘的侦探破解案件。你可以看到侦探走进房间、寻找线索、与嫌疑人交谈,但你听不到他们的内心独白。你看到了“行为”,却不知道其背后的“策略”。在人工智能的世界里,这些侦探被称为“AI智能体”(AI agents)。它们是受大型语言模型(可以将其想象为超级智能的文本预测引擎)驱动的计算机程序,能够解决复杂的、多步骤的问题,比如浏览网页、编写代码,甚至测试计算机安全性。但问题在于:虽然这些智能体解决问题的能力在不断增强,但它们也变得越来越难以理解。我们能看到最终结果,或者看到一长串杂乱无章的指令记录,但我们无法轻易看到它们是如何得出结论的“地图”。这就像是通过观察棋局结束时的照片来理解一位国际象棋大师的天才之处,却看不见他们是如何一步步走到那里的。

这篇题为 ATLAS 的论文解决了如何弄清楚这些 AI 智能体究竟是如何思考和行动的问题。作者希望将那些杂乱、混乱的指令列表转化为一张清晰、简单的地图——即一个“行为模型”——来展示智能体的策略。他们使用了两个主要技巧。首先,他们使用了一个强大的 AI(大语言模型)充当“翻译官”,将复杂的、具体的计算机命令转化为简单的、高层级的类别(例如,将 “sudo -l” 转化为 “检查特殊权限”)。其次,他们使用了一种名为“自动机学习”(automata learning)的数学技术,这就像是一个模式识别机器,通过观察所有被翻译后的动作来推导出游戏的规则。其目标是创建一个紧凑、易读的图表,不仅解释智能体做了什么,还解释了它为什么这样做,从而揭示出其中的循环、死胡同和成功路径。

侦探的秘密地图

那么,如何将一堆混乱的数字足迹转化为一张整洁、可理解的地图呢?该论文的作者构建了一个名为 ATLAS 的系统(Automata Learning for Agent Trajectory Analysis and Strategy Discovery,用于智能体轨迹分析与策略发现的自动机学习)。可以将 ATLAS 想象成一个神奇的摄像机,它不仅记录 AI 智能体做了什么,还能立即将它的动作转化为故事书格式,然后绘制出决策过程的流程图。

为了测试这一点,研究人员使用了一个专为渗透测试(penetration testing,这是一个高级词汇,指通过寻找计算机系统中的安全漏洞来进行的伦理黑客行为)设计的 AI 智能体。他们设置了一个包含 12 台不同“漏洞”机器(类似于数字练习目标)的情景,并让 AI 智能体尝试攻破它们。

第一步:原始的混乱
当 AI 智能体工作时,它会产生一个“轨迹”(trajectory)。这只是一个记录了它所做一切的原始日志。它可能看起来像这样:

  • 智能体输入: exec_command id
  • 计算机回复: uid=1000(lowpriv)...
  • 智能体输入: exec_command sudo -l
  • 计算机回复: (ALL) NOPASSWD:ALL...

对人类来说,这有点枯燥。但对于试图寻找模式的计算机来说,这是一场噩梦。其中包含了太多的具体细节(如精确的用户 ID 或冗长的错误信息),这些细节分散了对宏观图景的注意力。这就像是试图通过阅读每一帧的像素数据来理解一部电影,而不是通过观看情节来理解。

第二步:神奇的翻译官(抽象化)
这是 ATLAS 第一部分大放异彩的地方。研究人员使用了一个强大的 AI(“基础模型”)来充当翻译官。他们将杂乱的日志喂给这个 AI,并要求它将相似的动作归类为简单的类别。

  • 不再是 exec_command id,AI 说:“发现用户”
  • 不再是显示无密码 root 权限的 sudo -l,AI 说:“可利用的 Sudo 权限”

突然之间,杂乱的日志变成了一个清晰的故事:“智能体寻找了一个用户,找到了利用特殊权限的方法,然后尝试进行入侵。”这个过程被称为抽象化(abstraction)。它剥离了噪音,揭示了核心策略。

第三步:绘制地图(自动机学习)
一旦日志被翻译成这些简单的类别,ATLAS 的第二部分就会介入。它使用一种名为 Alergia 的算法,通过观察数百个这样的翻译后的故事,来构建一个马尔可夫链(Markov Chain)。

想象一个棋盘游戏。马尔可夫链就是该游戏的地图。

  • 圆圈(状态/States): 代表智能体在思考过程中所处的位置(例如,“刚刚开始”、“发现用户”、“发现弱点”)。
  • 箭头(转移/Transitions): 显示智能体下一步会做什么。
  • 数字: 显示采取该路径的概率。例如,“在发现用户后,有 70% 的概率智能体会尝试一个特定的命令,但有 30% 的概率它会感到困惑并尝试其他操作。”

通过从同一台机器上的 20 次尝试中学习,该系统构建了一张展示智能体典型行为的地图。它揭示了隐藏在原始日志中的模式。例如,地图显示智能体通常首先检查用户信息。如果它发现了弱点,它会在 30% 的情况下立即成功。但如果没发现,它往往会在尝试错误的命令中陷入循环,最后才最终成功。

他们发现了什么?

论文表明,这种方法的效果出奇地好。通过将原始日志转化为这些符号化的地图,研究人员可以实现两件很酷的事情:

1. 教导“初级”侦探(知识迁移)
研究人员从一个超级智能的 AI(DeepSeek V4)那里学习了“策略地图”,并利用它来帮助一个更小、更便宜、功能较弱的 AI(ministral-8b)完成同样的黑客任务。

  • 在没有帮助的情况下,这个小型 AI 的成功率仅为 5%
  • 当他们根据地图给这个小型 AI 一个“提示”(告诉它下一步该做什么)时,成功率跃升至 28.3%
  • 最有效的方法是“动态”引导,即地图充当 GPS 的角色,告诉小型 AI:“你现在处于第 3 步,现在执行 X 操作”,而不是给它一份冗长且令人困惑的指令清单。这表明,强大 AI 的“大脑”可以被浓缩成一张简单的地图,从而帮助较弱的 AI 表现得更好。

2. 解释“为什么”(解释模型)
有时,地图过于庞大复杂而难以阅读。研究人员展示了如何通过“切片”地图来专注于那些会导致成功的路径。他们可以切掉所有的死胡同和循环,留下一个简单的直线型图表,解释智能体是如何破解代码的。例如,在一种场景中,简化的地图显示,成功的关键仅仅是读取一个特定的文件(.bash_history)。这把一个 57 步的复杂过程简化为了一个 7 步的清晰解释。

大局观

作者谨慎地指出,这只是一个概念验证(proof of concept)。他们并没有解决 AI 安全领域的每一个问题,但他们展示了一种观察 AI 行为的新方法。他们认为,与其仅仅观察 AI 智能体运行并祈祷它们不出错,不如将它们的“轨迹”(即它们的动作日志)视为可以转化为正式模型的宝贵数据。

这些模型不仅仅是漂亮的图片。它们是工程工具。它们可以帮助我们:

  • 审计 AI 系统,查看其行为是否安全。
  • 调试它们,通过寻找它们在哪里陷入循环。
  • 迁移知识,将大容量、高成本的 AI 模型中的知识转移到更小、更快的模型中。

论文最后指出,这仅仅是个开始。如果我们能将 AI 智能体混乱的行为转化为清晰的数学地图,我们就能开始真正理解、信任并改进这些正成为我们世界重要组成部分的自主系统。这是让 AI 的“黑箱”变得透明一点的一步——将一个谜团转化为一张地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →