Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
本文介绍了异步归因指纹向量()方法和 SCD-v1 基准测试,旨在解决跨独立大语言模型智能体链接分布式、异步对抗会话的挑战,证明了在传统单会话检测器失效的情况下,结构与文体残留能够实现有效的活动归因。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的数字助手——那些编写代码、回答客户问题或分析数据的智能体(agents)——就像是一支独立的侦探团队。每位侦探都在自己的办公室里工作,拥有自己的笔记本,而且在执行任务时彼此并不交流。现在,想象一个想要窃取秘密的幕后黑手。他不是试图一次性攻破一个办公室,而是向不同的侦探在不同的时间发送一系列微小且令人困惑的线索。对于侦探 A 来说,这个线索看起来像是一个无伤大雅的拼写错误;对于侦探 B 来说,它看起来像是一个奇怪的格式错误;对于侦探 C 来说,它看起来像是一个普通的问题。如果每位侦探只看自己的笔记本,他们什么也发现不了。他们会想:“噢,只是个小故障。”但如果你能退后一步,同时观察整个团队的笔记本,你可能会意识到,所有这些微小的故障其实都是一场大型协同劫案的一部分。这就是“跨智能体”(cross-agent)攻击的问题:坏人隐藏在独立系统之间的缝隙中。
这篇论文探讨了计算机安全中的一个特定领域,即 LLM 智能体防御。简单来说,大语言模型(LLM)智能体是能够使用工具(如搜索网络或读取文件)来执行任务的聪明计算机程序。通常,安全团队通过一次向这些智能体提问一个问题来测试它们是否会被欺骗。但在现实世界中,攻击可能持续数天,跨越不同的团队和不同的程序发生。核心问题在于:我们能否将这些零散、孤立的事件联系起来,从而意识到它们都来自同一个坏人,即使我们并不知道这个坏人是谁?这篇论文的作者说“可以”,但他们使用了一种非常特定且巧妙的方法,这种方法并不依赖于智能体之间的相互通信。
来自 Tynapse 公司的研究人员推出了一种识别这些“幽灵”活动的新方法。他们将这种方法称为 A2FV(异步归因指纹向量)。把 A2FV 想象成一位超级聪明的侦探,他坐在所有智能体办公室外面,监视着他们发送和接收的邮件。这位侦探不需要阅读智能体大脑里的秘密想法(这在技术上是不可能的)。相反,他观察邮件中留下的“足迹”。
以下是这位侦探的工作原理:
- 结构足迹(The Structural Footprint): 当一个智能体使用工具(如“搜索”或“读取文件”)时,它会留下一个模式。即使坏人改变了他们使用的词汇,他们请求工具的顺序通常保持不变。这就像一个罪犯即使更换了外套和帽子,却总是穿着同一种特定款式的鞋子。
- 风格足迹(The Stylistic Footprint): 这是攻击的“笔迹”。即使坏人重写了他们的信息,他们可能仍会使用相同的奇怪标点、相同的措辞方式或相同的特定拼写错误。这就像一个伪造者可以模仿签名,却无法完全克制自己独特的字母倾斜度。
- 时间足迹(The Timing Footprint): 这追踪请求之间的时间间隔。虽然论文发现这在特定的测试中是一个较弱的线索,但它仍然是侦探工具箱的一部分,就像检查罪犯是否总是在每天的同一时间敲门一样。
该团队建立了一个特殊的测试环境 SCD-v1,以观察他们的侦探是否真的能破解此案。他们创建了一套混合了正常、枯燥流量和虚假攻击的场景,其中“坏人”在不同时间向不同的智能体发送相关的线索。他们确保了智能体无法共享笔记,并且攻击是分散进行的,正如现实世界中的情况一样。
结果非常令人振奋。当他们询问 A2FV 侦探是否能将这些会话进行关联时,它的正确率约为 82%(得分为 0.82)。为了直观理解,他们还尝试了其他方法,比如仅查看每个单独消息的“安全性评分”,或者要求一个巨大的 AI 来判断整体情况。那些其他方法基本上是在随机猜测,正确率仅为 50% 左右。论文指出,“结构”和“风格”足迹才是这里的真正英雄,它们在破解谜题中承载了最多的权重。
然而,论文非常谨慎地表示,这并不是解决一切问题的万灵药。他们测试了如果坏人试图改变其风格或时间规律来隐匿行踪时会发生什么。他们发现,虽然一个聪明的坏人可以增加将攻击归类为单一“活动”(例如分散线索)的难度,但他们无法完全抹除单个线索之间的联系。即使坏人试图伪装,这种“指纹”依然清晰可见,足以将这些会话联系起来。
作者还检查了他们的这种方法是否仅仅是特定计算机程序下的偶然现象。他们在不同的 AI 模型(如 Qwen 和 Gemini)上运行了相同的测试,发现结果依然成立。他们甚至检查了“坏人”是否只是利用相同的议题(如“窃取密码”)来欺骗系统。他们发现,即使主题相同,该方法仍能区分出真实的协同攻击与普通的类似问题提问。
简而言之,这篇论文表明我们需要一种新的 AI 智能体安全层。我们不能再仅仅孤立地观察每个智能体了。我们需要一个“中央观察者”,它可以观察攻击者留下的零散、异步的足迹,并断言:“嘿,这三个独立的事件实际上属于同一个幕后黑手。”虽然这并非能抵御所有未来可能的诡计的完美护盾(特别是如果坏人变得非常聪明并在实时进行调整),但它证明了将这些分散的攻击进行关联是可能的,也是可以衡量的。它将一团混乱的孤立警报变成了一个可以破解的谜题,让安全团队有更大的机会在坏人窃取“王国钥匙”之前抓住他们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。