← 最新论文
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

本文识别并形式化了“组合式行为泄露”(compositional behavioral leakage, CBL),这是一种存在于由提示词组合而成的智能体系统中的微妙失效模式,即由于 Transformer 自注意力机制中的架构非隔离性,编辑一个提示词模块会悄然改变其他模块的行为,并通过实证试验证明,这种干扰虽然在单个决策层面往往处于阈值之下,但在大规模部署中构成了显著的累积风险。

原作者: Ching-Yu Lin, Yifan Liu

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ching-Yu Lin, Yifan Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在通过粘贴不同的说明书来组装一个机器人助手。你有一页关于“如何有礼貌”的内容,另一页是“如何招聘员工”,第三页是“如何编写代码”。你把它们全部粘在一起,组成了一份巨大的文档,并把它交给机器人(即 AI)去阅读。

大家普遍做出的一个假设是:“如果我修改了‘如何有礼貌’那一页,它不会意外地改变机器人执行‘招聘’任务的方式。”

这篇论文指出:这个假设是错误的。

以下是研究人员发现的详细内容,使用了简单的类比:

1. 问题所在:“指令渗漏” (Instruction Bleed)

研究人员将这种现象称为 “指令渗漏”(或称“组合行为泄漏”)。

把 AI 的大脑想象成一个巨大的、开放式的房间,所有的指令页面都铺在地上。在普通的计算机程序中,如果你修改了“厨房”部分的规则,由于它们在不同的房间里,“车库”部分会保持原样。

但在 AI 中,“房间”是一个巨大的开放空间。AI 会同时阅读所有内容,将每一个词与每一个词联系起来。研究人员发现,如果你悄悄修改了一个本不该产生影响的页面(比如在“招聘”手册中加入一段随机的食谱),它可能会在无形中改变 AI 对求职者的评分方式。

类比: 想象你正在写一个故事。如果你突然在关于“汽车修理”的章节中间加入了一段关于“辣椒”的内容,AI 可能会下意识地开始认为汽车修理需要是“辛辣”或“火热”的,尽管你并没有这么要求。意义从一个章节“渗漏”到了另一个章节。

2. 实验:面试机器人

为了证明这一点,研究人员构建了一个特定的测试,使用了一个真实的 AI 代理,该代理旨在评估求职申请。

  • 设置: 他们有一个“核心”模块(负责根据简历匹配程度进行评分的部分)。
  • 诡计: 他们拿取了一个完全无关的模块(一套用于评估食谱的规则),并对其进行了三种类型的修改:
    1. 容量: 仅仅是让食谱部分变得更长。
    2. 内容: 在食谱规则中添加了一个奇怪且无关的人物描述。
    3. 形式: 在不改变文字的情况下,改变食谱部分的字体、表情符号或标题。

结果:

  • 修改长度格式(表情符号/标题)并不会真正改变招聘评分。
  • 但是,修改内容(添加那个奇怪的人物描述)导致 AI 系统性地改变了它对求职者的评分方式。
  • 分数发生了偏移,虽然幅度很小,但非常一致。AI 并没有开始拒绝所有人或录用所有人,它只是给出了略微不同的分数。

3. 为什么这很重要:“无声漂移” (Silent Drift)

这项发现最可怕的部分在于:没有人注意到它的发生。

  • “阈值之下”效应: AI 并没有犯下巨大的、明显的错误(比如雇佣一个小丑来当外科医生)。它只是微调了评分。
  • 隐喻: 想象一个原本用来称苹果重量的秤。如果你在房间的另一头放了一本厚书(无关的指令),秤并不会坏掉,但它开始把每颗苹果都称重了 0.5 磅。你不会看到单颗苹果“爆炸”或消失,但如果你称量 1,000 颗苹果,你的总库存计数就会出错。
  • 风险: 在现实生活中,如果 AI 被用于对成千上万的求职者进行排名,这些微小的、无声的偏移可能会改变谁能获得面试机会以及谁会被拒绝,即便此时 AI 看起来运行得非常完美。

4. 为什么会发生这种情况?

论文解释了这是因为 AI 的架构(称为“Transformer”)旨在同时观察整个文档。它们在不同的指令模块之间没有“墙壁”。

  • “没有墙壁”的现实: 仅仅因为你放入了一行星号(***)或一个标题如 ### 招聘规则,并不意味着 AI 会将其视为硬性的边界。对 AI 而言,这一切都只是一个巨大的词流。
  • “记忆”问题: AI 的“工作记忆”是有限的。当你增加更多文本(即使是无关的文本)时,它会挤占原本用于完美专注于原始任务的空间。

5. 研究人员的建议

这篇论文不仅指出了问题,还提供了一种新的测试方法。

  • 新的测试: 在你发布一个 AI 系统之前,你不应该只检查它是否有效。你需要检查修改一部分指令是否会破坏另一部分指令。
  • “回归”测试: 他们建议,每当开发者添加一个新的指令模块时,必须对旧的模块进行重新测试,以确保新添加的内容没有引起“渗漏”。

总结

这篇论文揭示了当我们通过拼接不同的文本指令来构建 AI 代理时,我们是在不稳固的基础上进行建设。修改指令的一部分可能会悄悄且微妙地改变 AI 在其他部分的表现,即使这些变化看起来毫无关联。这是一种目前的测试方法无法捕捉到的“无声漂移”,但它可能对招聘或贷款等决策产生现实世界的影响。作者提供了一份全新的清单,旨在这些隐形的泄漏造成麻烦之前将其拦截。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →