← 最新论文
💻 computer science

Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly

本文识别并量化了由决策时上下文组装(如截断和摘要)无意中丢弃承载指令的状态所导致的语言模型智能体“策略承载失效”,并评估了一种名为 SafeContext 的控制层,该层通过固定关键状态和注入提醒来部分缓解这些风险,但其有效性仍然有限且依赖于具体策略。

原作者: Igor Santos-Grueiro

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Igor Santos-Grueiro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《语境中的幽灵》的解释。

核心思想:机器中的“幽灵”

想象你是一名法庭法官。你面前有一大堆证据(对话历史),还有一套必须严格遵守的规则(策略)。但是,你只被允许阅读这堆证据中最上面的 10 页,然后就必须做出最终裁决。

这篇论文认为,AI 智能体面临着类似的问题。 在 AI 回答问题之前,一个“中间人”系统(称为决策时语境组装)会将对话历史切碎、总结,并将其压缩进一个小框中发送给 AI 模型。

可怕之处何在?如果中间人不小心丢弃了规则,或者将其改写得不再合理,AI 就可能会违反规则——即使 AI 本身很聪明,且规则在之前已被明确陈述。这篇论文将这种现象称为**“策略传递失败”**。规则确实存在,但它未能“传递”到决策时刻。

规则丢失的三种方式

作者发现了在“中间人”阶段,规则消失或被扭曲的三种具体方式:

  1. 驱逐(“在混乱中遗失”问题):

    • 类比: 想象你在一次漫长的电话通话开始时告诉朋友:“别忘了锁门。”等到通话结束时,你的朋友已经忘记了这条指令,因为你们聊了太多其他事情。
    • 发生了什么: 由于空间不足,规则被挤出了那个小小的“记忆框”。当 AI 需要采取行动时,它根本看不到这条规则。
  2. 别名化(“糟糕的翻译”问题):

    • 类比: 你告诉翻译:“不要吃红色的浆果。”翻译将其总结为:“小心浆果。”“红色”和“不要吃”这两个词消失了。AI 看到了一个警告,但这个警告太弱,无法阻止它吃掉浆果。
    • 发生了什么: 规则虽然幸存了下来,但被总结或改写得太松散,以至于不再严格禁止该不良行为。规则的“精神”被破坏了。
  3. 绑定不稳定(“错误目标”问题):

    • 类比: 你告诉保安:“阻止A 先生进入。”后来,保安看到一份总结,上面写着:“阻止B 先生进入。”规则依然存在,但它指向了错误的人。
    • 发生了什么: 规则文本虽然幸存,但它被错误地附加到了错误的对象、人物或条件上。

实验:测试“中间人”

研究人员在多个 AI 模型(如 Llama、Qwen 和 Mistral)上测试了这一点。他们创建了各种场景,要求 AI 在接收大量其他信息(工具输出、聊天记录、总结)的同时,严格遵守特定规则(如“不要删除数据”或“不要使用外部工具”)。

实验结果:

  • 问题真实存在: 没有任何辅助的情况下,AI 经常违反规则,因为“中间人”系统丢弃或削弱了指令。
  • 解决方案(SafeContext): 研究人员构建了一个名为SafeContext的安全层。你可以把它想象成规则的VIP 通行证
    • 它强制将规则“钉”在列表顶部,防止它们被丢弃。
    • 它高效地复用规则,使其不占用过多空间。
    • 如果对话变得过于拥挤,它会在 AI 回答前注入一条快速的规则提醒。

修复有效吗?

  • 是的,但有局限。 该修复帮助 AI 更频繁地遵守规则,特别是在对话非常拥挤的情况下。
  • 它不是魔法。 即使有了修复,AI 也没有获得满分。如果“中间人”使用了非常激进的总结器,修复措施无法完全挽救规则。
  • 更大的模型并非答案。 使用更聪明、更大的 AI 并不能自动解决问题。问题在于语境的组装方式,而不在于 AI 有多聪明。

安全的代价

这篇论文还探讨了这种安全的“代价”。

  • Token 成本: 保持规则安全有时需要向 AI 发送更多文本(例如添加提醒笔记)。
  • 好消息: 他们的“智能复用”方法(缓存)实际上在某些情况下节省了成本。与其每次都重写规则,他们只需指向旧版本,从而节省了空间。

结论

这篇论文得出结论:安全性不仅仅关乎 AI 模型本身。 它还关乎为 AI 记忆做准备的“装配线”。如果那条装配线丢弃了规则,无论 AI 多么聪明,它都会失败。

为了让 AI 更安全,我们需要将规则视为特殊的、受保护的项目,它们必须幸存下来并传递到 AI 的“大脑”中,而不能仅仅将其视为可以为了节省空间而被总结或删除的普通文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →