以下是用通俗语言和日常类比对论文《语境中的幽灵》的解释。
核心思想:机器中的“幽灵”
想象你是一名法庭法官。你面前有一大堆证据(对话历史),还有一套必须严格遵守的规则(策略)。但是,你只被允许阅读这堆证据中最上面的 10 页,然后就必须做出最终裁决。
这篇论文认为,AI 智能体面临着类似的问题。 在 AI 回答问题之前,一个“中间人”系统(称为决策时语境组装)会将对话历史切碎、总结,并将其压缩进一个小框中发送给 AI 模型。
可怕之处何在?如果中间人不小心丢弃了规则,或者将其改写得不再合理,AI 就可能会违反规则——即使 AI 本身很聪明,且规则在之前已被明确陈述。这篇论文将这种现象称为**“策略传递失败”**。规则确实存在,但它未能“传递”到决策时刻。
规则丢失的三种方式
作者发现了在“中间人”阶段,规则消失或被扭曲的三种具体方式:
驱逐(“在混乱中遗失”问题):
- 类比: 想象你在一次漫长的电话通话开始时告诉朋友:“别忘了锁门。”等到通话结束时,你的朋友已经忘记了这条指令,因为你们聊了太多其他事情。
- 发生了什么: 由于空间不足,规则被挤出了那个小小的“记忆框”。当 AI 需要采取行动时,它根本看不到这条规则。
别名化(“糟糕的翻译”问题):
- 类比: 你告诉翻译:“不要吃红色的浆果。”翻译将其总结为:“小心浆果。”“红色”和“不要吃”这两个词消失了。AI 看到了一个警告,但这个警告太弱,无法阻止它吃掉浆果。
- 发生了什么: 规则虽然幸存了下来,但被总结或改写得太松散,以至于不再严格禁止该不良行为。规则的“精神”被破坏了。
绑定不稳定(“错误目标”问题):
- 类比: 你告诉保安:“阻止A 先生进入。”后来,保安看到一份总结,上面写着:“阻止B 先生进入。”规则依然存在,但它指向了错误的人。
- 发生了什么: 规则文本虽然幸存,但它被错误地附加到了错误的对象、人物或条件上。
实验:测试“中间人”
研究人员在多个 AI 模型(如 Llama、Qwen 和 Mistral)上测试了这一点。他们创建了各种场景,要求 AI 在接收大量其他信息(工具输出、聊天记录、总结)的同时,严格遵守特定规则(如“不要删除数据”或“不要使用外部工具”)。
实验结果:
- 问题真实存在: 没有任何辅助的情况下,AI 经常违反规则,因为“中间人”系统丢弃或削弱了指令。
- 解决方案(SafeContext): 研究人员构建了一个名为SafeContext的安全层。你可以把它想象成规则的VIP 通行证。
- 它强制将规则“钉”在列表顶部,防止它们被丢弃。
- 它高效地复用规则,使其不占用过多空间。
- 如果对话变得过于拥挤,它会在 AI 回答前注入一条快速的规则提醒。
修复有效吗?
- 是的,但有局限。 该修复帮助 AI 更频繁地遵守规则,特别是在对话非常拥挤的情况下。
- 它不是魔法。 即使有了修复,AI 也没有获得满分。如果“中间人”使用了非常激进的总结器,修复措施无法完全挽救规则。
- 更大的模型并非答案。 使用更聪明、更大的 AI 并不能自动解决问题。问题在于语境的组装方式,而不在于 AI 有多聪明。
安全的代价
这篇论文还探讨了这种安全的“代价”。
- Token 成本: 保持规则安全有时需要向 AI 发送更多文本(例如添加提醒笔记)。
- 好消息: 他们的“智能复用”方法(缓存)实际上在某些情况下节省了成本。与其每次都重写规则,他们只需指向旧版本,从而节省了空间。
结论
这篇论文得出结论:安全性不仅仅关乎 AI 模型本身。 它还关乎为 AI 记忆做准备的“装配线”。如果那条装配线丢弃了规则,无论 AI 多么聪明,它都会失败。
为了让 AI 更安全,我们需要将规则视为特殊的、受保护的项目,它们必须幸存下来并传递到 AI 的“大脑”中,而不能仅仅将其视为可以为了节省空间而被总结或删除的普通文本。
技术摘要:上下文中的“幽灵”
问题定义
本文识别出大型语言模型(LLM)代理中存在一种独特的安全失效模式,称为决策时上下文组装期间的策略承载失效。
在已部署的代理栈中,模型并非直接基于原始交互历史采取行动。相反,编排层(E)在最终模型调用(M)之前,通过截断、摘要、重排序和重写先前的状态,组装出一个有界的“决策状态”(Ct)。作者认为,安全边界不仅延伸至模型权重和可见的提示表面,还必须包含这一组装子系统。
核心威胁在于,承载指令的状态(例如安全策略、允许/拒绝规则、权限约束)必须与工具输出、规划者笔记和用户内容竞争有限的令牌预算。如果组装过程在模型看到这些指令之前将其丢弃、削弱或重新绑定,代理即可在不进行任何提示注入、模型破坏或持久记忆中毒的情况下跨越策略边界。攻击者只需控制调度压力(非控制内容的体积和顺序)即可诱发这些失效。
本文将这些失效分为三类:
- 驱逐(Eviction):承载指令的状态被置换,不再到达决策状态(可用性失效)。
- 别名化(Aliasing):指令虽然幸存,但在语义上被削弱、重写或扭曲,未能保留原始的操作边界(完整性失效)。
- 绑定不稳定性(Binding Instability):指令仍然可见,但被重新绑定到错误的执行者、对象或条件(引用漂移)。
方法论
本研究在本地对齐模型上通过受控的封闭实验评估了这些失效模式,包括:Llama 3.1 8B、Qwen 2.5 7B和Mistral 7B,并扩展至Qwen 2.5 14B和Llama 3.1 70B。
实验设置
- 预算机制:采用刻意严苛的 260 令牌决策时预算。这迫使系统 scaffolding、工具轨迹、摘要和最终查询之间进行现实的权衡,确保策略竞争是可观测的。
- 攻击向量:通过改变“填充”内容(工具输出、规划者笔记)相对于承载指令片段的顺序和体积,构建旨在诱发驱逐、别名化和绑定不稳定性的场景。
- 指标:
- 精确约束保留率(ECR):最终答案是否完全遵守所有适用约束。
- 约束生存率(CSR):部分遵守的分级度量。
- 决策翻转率(DFR):仅改变提示顺序是否会导致控制结果发生翻转。
- 直接保留率(DPR):对组装后的决策状态进行直接审计,以验证在模型调用前约束标记是否明确可见。
干预措施:SafeContext
作者提出并评估了SafeContext,这是一种在不修改模型权重的情况下干预组装过程的控制层。其机制包括:
- 准入控制(LPC):在预算竞争之前将传入片段分类为“策略”或“数据”。
- 语义控制固定(SCP):为承载指令的状态预留受保护的预算,并将其固定在决策状态中。
- 感知缓存的前缀复用:跨轮次复用保留的控制前缀,以避免重新序列化的成本。
- 侵入式上下文工程(ICE):当输入令牌压力超过阈值(安全半衰期)时,在最终查询附近触发简短的控制提醒。
- 权限绑定分数(ABS)审计器:验证幸存的指令是否仍绑定于其预期的对象。
关键结果
1. 系统性未缓解风险(C1)
未缓解的风险是系统性的。在低预算机制下,所有模型和攻击家族中的精确约束遵守(ECR)极低。
- 驱逐和别名化是主要的失效模式。
- 绑定不稳定性较小且噪声更大。
- 在没有缓解措施的情况下,承载指令的片段在模型调用前经常被普通历史置换或削弱。
2. 针对强压缩的残留效应(C2)
缓解措施的有效性高度依赖于竞争的组装策略。
- 针对简单的截断,SafeContext 在 ECR 上产生了微小但积极的提升(例如,SCP+ICE 从约 0.027 上升至约 0.061)。
- 针对强结构化压缩(B2+),整体提升几乎消失。残留收益几乎完全集中在溢出驱逐(压力最高处)和特定的别名化切片中。
- 仅重放(简单地重复约束)并不能解释该效应;收益来自于对控制状态的具体处理(固定和隔离),而不仅仅是近期性。
3. 异质性与规模(C3)
- 该效应是反复出现的,但具有异质性。缓解收益的符号和幅度取决于模型先验与特定组装策略之间的相互作用。
- **更大的模型(14B、70B)**并未消除该现象。虽然 Qwen 14B 在别名化方面显示出积极结果,但 Llama 70B 仍然受策略条件限制。规模并未将失效模式简化为单纯的“更大模型”效应; governing rule(支配规则)仍必须在决策时实时到达并被正确表示。
4. 成本 - 收益概况(C4)
SafeContext 引入了安全与开销之间可调节的权衡:
- SCP(准入/固定):成本低(约 +5 令牌),ECR 收益适中。
- SCP+ICE:成本较高(约 +37 令牌),ECR 收益更高。
- SCP+Cache+ICE:通过避免固定控制片段的重新序列化,实际上可以减少总令牌计数(约 -365 令牌),同时仍能实现最高的 ECR 收益。
- “安全收益”并非均匀的;它在承载控制的状态压力最大时最为显著。
意义与主张
本文主张,决策时上下文组装是 LLM 代理控制路径中可测量且独特的组成部分。
- 威胁模型转变:安全不能仅限于模型权重或最终提示表面。组装上下文的子系统(E)是可信计算基(TCB)的一部分。攻击者无需注入恶意字符串;他们只需操纵调度压力,导致权威指令被丢弃或削弱。
- 失效分解:本文将失效分类法(驱逐、别名化、绑定不稳定性)具体化,超越了通用的“长上下文退化”,转向具体的控制状态失效。
- 部分加固:即使经过缓解,绝对的精确遵守率仍然较低,但对承载指令状态的目标化处理(准入、固定和压力触发的强化)可以部分加固系统。
- 设计启示:承载指令的状态必须被视为一等运行时状态,区别于普通的对话或工具生成的上下文。它需要明确的准入路径、预留的预算和完整性审计,而不能任由机会主义压缩。
作者总结道,虽然更大的窗口和通用的内存改进并未消除这一问题,但有限制组装中策略承载的具体失效可以通过编排层干预进行分解、测量和部分缓解。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。