← 最新论文
🤖 AI

Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

本文介绍了 Magnet,这是一个检测框架,它通过聚合来自多个隔离智能体交互的看似无害的伪影,来重建那些能够规避传统单会话监控的有害目标,从而解决了识别跨会话 AI 滥用的关键空白。

原作者: Natalie Isak, Matthew Dressman

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Natalie Isak, Matthew Dressman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:人工智能不再只是一个单一的、爱聊天的机器人,而是一支由专业助手组成的编队。你可以把它们想象成一支建筑施工队:一个负责铺砖,另一个负责搅拌水泥,第三个负责刷墙。它们协同工作,共同建造出令人惊叹的建筑。但是,如果一个狡猾的捣蛋鬼试图利用这支队伍去建造一些危险的东西,比如一个陷阱,会发生什么呢?这个捣蛋鬼知道,如果他一次性要求整个团队建造一个陷阱,工头(安全系统)就会说:“没门!”并立即阻止他。于是,捣蛋鬼变得更加聪明了。他将那个宏大且邪恶的计划拆解成许多微小的、枯燥且看起来完全无害的任务。他让砌砖工只是“找一块红砖”,然后让油漆工“找一桶蓝漆”,稍后又让水泥搅拌工“找一些胶水”。每一个请求单独看都是天真无邪的。问题在于,AI 团队在任务之间会遗忘一切——它们对前一天的工作没有任何记忆。但捣蛋鬼却记得。他收集所有这些微小的、看似无害的碎片,稍后再将它们组合起来,从而建成陷阱。这篇论文探讨了这种“分而治之”的诡计是如何运作的,并提出了一种在陷阱完工前抓住捣蛋鬼的新方法。

研究人员娜塔莉·伊萨克(Natalie Isak)和马修·德雷斯曼(Matthew Dressman)将他们的新检测工具称为 Magnet(磁铁)。他们发现,目前的安全系统就像只盯着单个人的保安。如果一个人进来先要了一把锤子,过一会儿又要了些钉子,再过一会儿又要了一些木头,保安看到的只是三个独立的、无害的请求。保安并没有意识到,如果你把这三样东西凑在一起,就可以制造出一件武器。论文表明,通过将有害目标拆分为许多细小的、孤立的会话,攻击者可以成功绕过这些保安。在他们的测试中,这种“跨会话”的诡计比尝试一次性完成任务的效果要好得多。例如,在尝试创建网络钓鱼套件(一种窃取密码的工具)或制作燃烧瓶的指令时,当请求被拆分到多个独立的会话中时,成功率从约 18% 跃升至近 37%。

论文认为,我们不能仅仅关注某人在说什么(其意图),而应该开始追踪他们实际在构建什么(其能力)。意图很容易伪造;你可以说“我正在写一个关于坏蛋的故事”来掩盖真实的计划。但他们收集到的实际部件——一个登录表单、一段发送电子邮件的脚本、一个化学配方——却很难隐藏。Magnet 的工作原理就像是在干草堆中寻找磁铁。它不是去检查每一根稻草(每一次对话)是否危险,而是从用户进行过的所有会话中,精准地吸取出那些“针头”(特定的、危险的能力)。它记录了用户收集到的每一个危险部件的清单。如果一个用户收集了足够多的部件来完成一套危险的组合——比如,他已经拥有了表单、邮件脚本和托管指令——Magnet 就会拉响警报,即便其中任何一个部件单独看都显得毫无威胁。

研究人员将这个想法与其他方法进行了对比测试。他们发现,简单地将过去的对话压缩成一段简短的摘要(类似于“精彩集锦”)往往会失败,因为坏的部分容易淹没在大量无害信息的噪音中。然而,Magnet 在识别模式方面表现得更出色。在模拟实验中,Magnet 捕捉到了 7ற்க 75% 的攻击,同时保持了较低的误报率,而传统的“单会话”保安仅能捕捉到约 45% 的攻击。论文指出,随着 AI 智能体变得更加普遍,并且在不同的对话中开展工作,安全系统需要发生改变。它们不应仅仅盯着对话窗口,而应该盯着用户的长期“能力库存”。虽然这项研究侧重于网络钓鱼和武器等特定危险,但作者认为,这种方法也可以帮助发现其他缓慢积累的问题,比如某人如何在数周或数月内被逐渐诱导走向有害行为。核心启示在于,危险往往隐藏在许多微小的、看似无害的部分的总和之中,而我们需要一种全新的探测器来洞察全局。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →