← 最新论文
💻 computer science

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

本文提出了 MIND,一种轻量级防御框架,该框架利用意图感知的瓶颈理论(Information Bottleneck)来提取紧凑的意图-行为表示,在保持任务准确性和推理效率的同时,有效地过滤大语言模型(LLM)智能体中的中毒记忆。

原作者: Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手,它能与你交谈、查阅资料,并能在多次对话中解决复杂的问题。为了变得真正出色,这个机器人需要一个“记忆库”——一个存储你过去聊天笔记的地方,这样它就不会忘记五分钟前我们在聊什么了。这就像学生通过笔记本记录课堂笔记,以帮助完成一个长期项目一样。然而,这里有一个可怕的故障:一个狡猾的黑客可能会偷偷向这个笔记本里塞进一条虚假的、带有毒素的笔记。如果机器人稍后读到了这条假笔记,它可能会变得困惑,忘记最初的目标,从而做出愚蠢或危险的行为,比如白送钱或者把数学题算错。这被称为“记忆注入攻击”。

科学家们面临的大挑战是如何在不减慢机器人速度的情况下阻止这些假笔记。旧的检查方法就像雇佣一位人类老师去逐一阅读机器人找到的每一条笔记,看它是否是假的。这既费时又耗能。其他方法试图快速扫描笔记,但它们会被对话中所有枯燥、重复的细节所迷惑,从而忽略了真正的危险信号。所以,问题在于:我们能否构建一个智能且快速的过滤器,既能忽略那些无聊的噪音,又能只寻找那种暗示着“嘿,这条笔记正试图欺骗我们”的特定“氛围”?

这正是开发“MIND”论文的研究人员试图解决的问题。他们创建了一种名为 MIND(记忆意图感知神经去噪)的新型防御系统。把 MIND 想象成一个超级高效的夜店保安。它不会要求每一位客人(每一条记忆)都背诵自己的生平故事(这太慢了),而是使用了一个被称为“信息瓶颈”的特殊技巧。想象你有一大堆乱七八糟的衣物(对话历史)。其中大部分只是现在并不重要的袜子和衬衫。MIND 就像一台神奇的烘干机,它将一切都缩小,扔掉那些蓬松、无用的东西,只保留能告诉你这个人真实身份的紧凑且本质的核心。

研究人员发现,当机器人被黑客欺骗时,它的行为会开始偏离用户最初的要求。这就像一个朋友开始表现得与往常非常不同,变得有些古怪。MIND 会监视这种偏移。它将机器人的长篇对话压缩成一个微小、干净的摘要,重点突出用户最初的问题与机器人当前回答之间的联系。如果机器人正在被投毒,这种联系就会断裂,而 MIND 会立即发现这个“假”记忆。

论文显示,这种方法的效果非常出色。在测试中,MIND 能够降低 55% 的攻击成功率(将黑客的成功率从高数值降至极低水平),同时保持机器人原有的聪明才智和反应速度。与其他让机器人思考时间增加一倍的旧方法不同,MIND 实际上比 LLM 审计器(LLM Auditor)快了 20.6%。这就像是一个能在瞬间识破小偷的保安,而不会让你在排队时等待。作者发现,通过忽略“噪音”并专注于“意图”,他们可以确保机器人的安全、快速且不偏离轨道,这证明了你不需要一个庞大、缓慢的大脑来捕捉巧妙的诡计——你只需要正确的专注力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →