Authorization Before Context: A Model-Neutral Audience Boundary Against Cross-Audience Memory Leakage in Agentic Systems
本文提出了“授权先于上下文”(authorization before context)这一模型中立的安全不变式,通过在记忆到上下文的转换阶段强制执行严格的受众成员身份规则,防止智能体系统中出现跨受众的记忆泄漏,从而确保无论模型行为或中毒输入如何,为更窄受众记录的事实都不会暴露给更广受众。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位永不遗忘任何事物的私人助手。这位数字助手倾听你的私人对话,记得你与朋友的群聊内容,并存储你工作会议的细节。它的设计初衷是提供便利,在恰当的时机调取正确的信息,以帮助你撰写消息或回答问题。但这种优势本身也造成了一个危险的弱点。如果助手在你在与朋友独处时得知了一个秘密,它绝不能在稍后面对老板时,即便老板提出的问题看似需要该信息,却又不小心把这个秘密泄露出去。危险在于助手构建思想的方式。在它开口说话之前,它会收集一系列笔记和记忆来喂给它的“大脑”。如果它抓取了一条仅属于你和朋友的私人笔记,并将其滑入发给老板的消息中,秘密就泄露了。伤害发生的时刻是在笔记被包含进去的那一瞬间,远在助手甚至还没形成完整的句子之前。
这正是这项新研究所针对的具体问题:如何阻止智能助手在无意中向错误的人分享私人记忆。研究人员将重点放在助手收集笔记的精确时刻。他们提出了一个简单的、严格的规则,作为进入助手工作记忆之前的守门人。该系统不再询问“这条笔记是否有用?”或“它是否符合问题?”,而是问一个单一且不容置疑的问题:“在最初编写这条笔记时,所有正在听这条消息的人是否都在场?”如果答案是肯定的,则允许该笔记进入。如果当前对话中的哪怕只有一个人在编写笔记时不在场,该笔记也会立即被拦截。这个规则就像一个检查宾客名单的门卫,但它在派对开始之前就完成了这项工作,确保没有任何私人信息会跨越界限进入不属于它的房间。
研究人员使用了一个旨在模拟现实世界混乱与欺骗行为的计算机模拟环境来测试这一想法。他们创建了一个包含七十九种不同情况的场景,范围从简单的单对单聊天到参与者身份不明或不断变化的复杂群聊。在每一种情况下,他们都试图诱导系统泄露秘密。他们模拟了一个场景:一条笔记是在两人之间的私人聊天中编写的,然后助手试图在三人群聊中使用这条笔记。他们还模拟了一个场景:一名恶意攻击者在私人对话中植入了一条虚假笔记,希望它稍后会出现在公共场合。在所有七十九次尝试中,这项严格的规则都守住了阵地。没有一个被禁止的事实进入助手的工作笔记。系统成功拦截了每一条未经授权的信息,证明了该规则是靠设计实现的,而非靠运气。
这种方法的不同之处在于,它并不依赖人工智能自身的谨慎程度。许多现有系统试图在事后解决问题,寄希望于人工智能能注意到错误并拒绝说出私密内容,或者试图通过编辑最终答案来删除敏感词汇。研究人员认为这为时已晚;私人信息已经被 AI 的大脑看到了。他们的方法在 AI 看到那条禁止的笔记之前就阻断了泄露。他们将助手的记忆视为一组锁定的盒子,每个盒子都贴有特定标签,标注了放入内容时在场的具体人群。只有当当前的人群与标签完全匹配时,系统才会打开盒子。如果人群规模更大或不同,盒子就会保持关闭。这确保了在小圈子内分享的秘密永远不会意外流向更大的群体,同时也确保了在私人聊天中植入的虚假笔记无法传播到公共聊天中。
研究还观察了当系统不确定谁在聆听时的情形。在现实生活中,技术有时无法准确识别对话中的成员。研究人员将程序设定得极其谨慎。如果系统无法清晰识别当前的听众,它会假设最坏的情况:即观众是所有人。这意味着它只会展示那些最初面向全世界共享的信息,从而有效地隐藏所有私人笔记。这种“故障安全”行为确保了不确定性永远不会导致泄露。研究人员确认,无论笔记是以简单的列表、摘要还是复杂的连接网络形式存储,他们的规则在各种类型的记忆存储中都能有效运作。在所有实例中,该规则都充当了连贯的屏障,防止未经授权的信息进入助手的视野。
尽管结果令人鼓欣,但研究人员谨慎地指出,他们的发现来自于一个受控的合成环境。他们并未在拥有真实人类用户或实时对话的现实世界助手上进行测试。这些测试是一场严密的模拟,是一个规则被完美执行的数字试验场。他们尚未证明这套系统在混乱、不可预测的现实世界中能完美运作,也尚未证明它能处理所有可能的被欺骗方式。然而,核心理念——即一个简单的预检规则可以通过设计来阻止记忆泄露——已在他们尝试的所有场景中得到了证实。这项工作表明,通过改变我们在收集信息之前的权限检查方式,而不是在错误发生后试图修复,我们可以构建出默认尊重隐私的助手,让私人记忆始终留在它们该在的地方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。