MutMem: Cryptographically Authorized Mutation in Persistent Agent Memory
MutMem 是一种用于持久化智能体记忆的加密授权突变协议,它通过对权重转换和证据进行签名,确保了完整性与可追溯性,在实现高检索准确度的同时,具备抵御投毒攻击的鲁棒性,且不会损害历史连续性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在建造一个永不遗忘的机器人朋友。它记得你最喜欢的披萨配料、你三年级老师的名字,以及你承诺遛狗的时间。但这里有一个棘手的部分:人是会改变的。也许你现在决定讨厌菠萝披萨了,或者你意识到你的三年级老师其实叫“史密斯女士”,而不是“琼斯女士”。如果你的机器人朋友只是用新记忆覆盖旧记忆,你如何知道它没有被黑客攻击?你如何证明这种改变是你进行的真实更新,而不是一个伪装成你的隐蔽病毒?这就是人工智能中“持久记忆”的问题。科学家们正试图构建能够学习并适应数年之久的 AI,但他们需要一种方法来确保这些变化是经过授权且可追踪的,就像一本数字日记,无法在不留下指纹的情况下被秘密编辑。
这篇论文介绍了一个名为 MutMem(简称“可变记忆”)的巧妙系统,它是为名为 HOM-AIMOS 的机器人大脑引擎设计的。把 MutMem 想象成 AI 记忆的一个超级安全、神奇的账本。当新信息到来时,MutMem 不会抹除旧的事实,而是会在旧记忆旁边添加一个“签名便签”。这个便签会说:“嘿,我们因为这个新事件更新了这条记忆的重要性,以下是证明此次更新已获授权的加密证明。”这就像如果你在图书馆的一本书的页边空白处写下了一处更正,但这个更正带有独特的、不可破解的火漆印章,证明这是你做的,而不是小偷做的。该系统还有一种处理“中毒”信息(即黑客植入的假事实)的特殊方式。MutMem 不会删除这些假事实(因为删除会掩盖攻击的证据),而是保留它们,但给它们盖上一个巨大的、带有签名的“可疑(SUSPICIOUS)”标签。这样一来,AI 就会忽略这些虚假信息,而研究人员稍后仍可以研究这次攻击。
研究人员通过三种方式测试了这个系统。首先,他们检查了机器人是否能利用其记忆正确回答问题。在一项名为 LongMemEval 的高难度测试中,机器人的回答正确率达到了 91.8%。在另一项长时记忆测试 LoCoMo 中,它的正确率为 74.12%。这些数字表明,该记忆系统在处理常规任务时表现良好。
其次,他们测试了安全性。他们运行了一套专门的测试套件,试图诱导系统进行未经授权的更改或删除记忆。系统成功检测到了这些特定场景下的每一次篡改尝试,例如尝试跨不同记忆重复使用签名或修改数字印章。每当发生更改时,系统都会用数字签名将其锁定。如果在这些测试中有人试图篡改记忆,系统会立即发现印章破损。进行安全更新的过程也非常快,平均仅需约 4.865 毫秒——比人类眨眼还要快。
第三,他们测试了系统处理“中毒”数据的能力。他们模拟了一次攻击,黑客向机器人的记忆中注入了 500 条虚假的、具有误导性的段落。系统并没有删除这些假段落;相反,它保留了这些内容,但将其标记为“疑似中毒(poison_likely)”并附带了签名标签。当机器人被问及黑客试图误导它的问题时,系统成功地忽略了这些虚假信息,成功率达 97%(只有 3% 的情况下机器人会意外使用中毒信息)。至关重要的是,系统并没有因此变得混乱或失去正确回答普通问题的能力;即使在受到攻击时,其准确性依然保持在高水平。
论文还进行了一项特别实验,以探究为什么该系统在对抗“毒素”方面表现得如此出色。他们发现,“签名标签”正是英雄。当机器人利用这些标签来忽略虚假信息时,它在应对陷阱问题时的准确率从 40% 跳升到了 65%。如果没有这些标签,机器人很容易被愚弄。
然而,作者非常谨慎地指出该系统“不能”做什么。它并不能证明记忆在现实世界中确实是“真实”的。一个机器人可以拥有一份经过完美签名、获得授权的记忆,但其内容在事实上仍然是错误的(比如它记得你讨厌菠萝,而实际上你很喜欢)。该系统只能证明记忆是由正确的人更新的,并且变更的历史是诚实的。这是一个关于信任和追踪的系统,而不是寻找绝对真理的系统。
最终,MutMem 表明我们可以构建既能灵活学习和改变,又能通过数字印章确保更新路径可追溯且安全的 AI 记忆。它保留了每一次更新、每一份怀疑和每一次更正的历史,并将它们全部锁死在不可破解的数字印章中,确保即使 AI 的大脑规模庞大且复杂,我们也始终能够追踪其思想的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。