Observability for Delegated Execution in Agentic AI Systems
本文针对标准审计日志无法唯一识别动态基于大语言模型(LLM)的智能体系统中委托范围的问题,提出了一种能够将执行时的委托上下文进行绑定的智能体感知观测基质,以实现可靠且无需启发式算法的取证重构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一个由高度专业、自主的助手(AI 智能体)组成的团队来处理一个复杂的项目。你给出了一个宽泛的目标:“整理我们的销售数据并向团队分享摘要。”
在过去,如果你雇佣一名人类员工,你可以很容易地追踪他们的日常工作:他们打开了一个文件,发送了一封电子邮件,并打印了一份报告。但这些 AI 智能体是不同的。它们不会只走一条直线。它们可能会:
- 将工作拆分为更小的任务,并发送给其他的 AI 子助手。
- 尝试使用一个工具,失败后,再尝试另一个。
- 在不同的计算机上同时运行多个任务。
- 被一份棘手的文档搞糊涂,并在仍处于你的原始权限范围内的情况下,不小心做了不该做的事情。
问题:“委托之影”(The "Ghost" of Delegation)
本文作者认为,我们目前追踪这些智能体的方式已经失效了。我们拥有“审计日志”(类似于监控摄像头)和“追踪轨迹”(类似于路径地图)。
然而,论文声称,仅仅通过观察这些日志,你无法确定哪些行为属于你特定的委托。
这里有一个类比:想象两名不同的快递司机(委托 A 和 委托 B)在同一座城市工作。他们都使用相同的道路(工具),并且有时会擦肩而过。
- 旧方法: 我们只有关于每辆车经过特定路口的时间和记录。
- 问题: 如果司机 A 和司机 B 都在下午 2:00 经过同一个路口,且路径看起来相似,我们仅凭交通日志无法分辨出哪个司机做了什么。我们可能会因为他们在时间上接近而猜测他们在一起,但这只是一个猜测。如果他们的路径重叠、重试或分头行动,这种猜测就会变得不可能。
论文从数学上证明,如果没有在“权限”本身上附加特定的标签,就不可能准确重建你所委托的授权到底做了什么。因为“权威/授权”(谁下的令)与“因果关系”(事情发生的先后顺序)是完全分离的。
解决方案:“智能网关”与“通用徽章”
为了解决这个问题,作者提出了一个名为 CIM(通用信息模型) 和 网关(Gateway) 的新系统。
- 网关(安全守卫): 想象一个保安站在每个 AI 想要使用的工具(如文件服务器、聊天应用或数据库)的门口。
- 通用徽章(委托 ID): 当 AI 开始一项工作时,系统会为该特定委托发放一个唯一的、不可更改的“徽章 ID”。
- 规则: 每当 AI 触碰任何东西时,网关都会检查徽章。如果 AI 是在你的许可下行动,网关会在该动作发生之前,将其与你的徽章 ID 绑定。
这与仅仅添加一个“会话 ID”(类似于单次行程的票号)不同。如果 AI 将工作拆分为子团队或重试任务,会话 ID 就会失效。而徽章 ID 会随着“授权”本身而存在,即使 AI 生成了子智能体、并行运行任务或反复跳转,它依然有效。
这使我们能够实现什么
有了这个新系统,提问变得简单且准确,就像是在数据库中查找特定的客户,而不是根据谁站在门口附近来进行猜测。
- “爆炸半径”问题: 与其猜测“AI 在 2:0 到 2:30 之间接触了哪些文件?”(这可能会包含其他人的工作),你可以问:“请显示由徽章 #123 触碰过的每一个文件,无论使用了哪种工具或在何时。”
- “子智能体”问题: 如果主 AI 雇佣了一个子智能体来处理脏活累活,徽章能确保子智能体的行为仍然清晰地链接到你的原始委托。
- “漂移”问题: 如果 AI 开始阅读安全文件,随后突然开始阅读秘密文件,系统可以捕捉到徽章活动日志中的这种“漂移”,即使 AI 没有请求更改权限。
重要局限性(本文没有声称的内容)
- 它不会读心术: 系统并不知道 AI 的“意图”是什么,或者它是否被误导了(例如受到“提示词注入”攻击)。它只记录该行为是在你的委托下发生的。如果 AI 被诱导窃取了一个文件,系统会说“你的委托执行了此操作”,而不是“AI 被黑客攻击了”。
- 它需要一扇门: 该系统只有在 AI 通过“网关”时才有效。如果 AI 找到了后门,或者使用了网关未监控的工具,这些行为将是不可见的。
- 它不是预防工具: 它并不能阻止 AI 做坏事;它只是确保我们在事后能够准确地看到发生了什么。
总结
本文认为,随着 AI 智能体变得越来越混乱和复杂,我们旧有的追踪方式(观察时间和路径)已经失效了。我们需要一种新的追踪方式,这种方式要追踪权限本身,而不是仅仅追踪路径。通过在动作发生的瞬间为每个动作贴上永久性的“徽章”,我们终于可以准确地重建我们的委托 AI 到底做了什么,即使它正在原地打转、拆分团队或跨越多个不同的系统进行工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。