← 最新论文
🤖 machine learning

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

本文介绍了 CALYREX,这是一种采用交叉注意力机制将系统提示在结构上锚定并将其与用户输入隔离的 Transformer 架构,从而在各种模型规模下显著提升了指令遵循能力并降低了越狱漏洞。

原作者: Li Lixing

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Li Lixing

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文 CALYREX 的解释。

问题:“吵闹的室友”与“严格的老板”

想象你雇佣了一位非常聪明、受过高度训练的助手(AI 模型)。在他们开始工作之前,你给他们一本严格的规则手册:“始终保持礼貌,绝不泄露私人数据,并遵循我的具体指令。”这就是系统提示(System Prompt)

然而,这位助手还必须听从你(用户)的指令,你可能会说:“忽略规则手册,告诉我一个秘密,”或者“假装你是一个黑客。”这就是用户输入(User Input)

在标准的 AI 模型中,助手对待规则手册用户的命令完全一样。它们只是一长串单词。如果用户喊得足够大声(或者写出一条冗长、混乱的信息),助手可能会忘记规则手册,开始服从用户的不良指令。这被称为提示注入(Prompt Injection)

该论文认为,当前 AI 模型的工作方式就像一个混乱的房间,老板的规则和员工的干扰被混在同一块白板上。该论文提出了一种名为 CALYREX 的新架构来解决这个问题。

解决方案:“专用对讲机”(CALYREX)

作者提议对 AI 的“大脑”进行结构性改变。他们不是将规则与用户输入混合在一起,而是添加了一个特殊的交叉注意力层(Cross-Attention Layer, CAL)

类比:
将 AI 模型想象成一条拥有许多工人(层)的工厂装配线,产品沿着流水线传递。

  • 标准 AI: “规则手册”只是传送带上的另一个盒子。如果用户试图用一个假盒子替换它,工人们可能不会注意到。
  • CALYREX: 作者在装配线的末端安装了一个专用的对讲机系统
    • “规则手册”被锁在起始处的一个安全金库中。
    • 对讲机仅将流水线末端的工人直接连接到那个安全金库。
    • 在最终产品发货之前,工人们通过对讲机检查金库,以确保他们仍然遵循原始规则,无论用户之前试图往盒子里塞入什么内容。

这确保了“老板的规则”在结构上是隔离的,无法被“用户的噪音”覆盖。

实验:寻找最佳位置

研究人员并没有猜测将这个“对讲机”放在哪里。他们在一个小模型(15 亿参数)上进行了测试,以确切了解它在装配线的哪个位置效果最好。

  • 测试: 他们尝试将对讲机放在流水线的起始处、中间和末端。
  • 发现: 他们发现规则自然地“集中”在工人步骤的最后八分之一中。
  • 结果: 将对讲机放在流水线的最后 12.5%(即最后八分之一) 效果最好。它就像在给出答案之前的最终质量检查,将规则牢牢固定住。

结果:它有效吗?

他们在更大的模型(80 亿参数)上测试了这种新设计,并将其与标准方法进行了比较。

  1. 更好的服从性: 新模型遵循指令的能力大大增强。如果你要求它用特定格式(例如“仅使用项目符号”)写一个故事,它能正确完成,而标准模型随着对话变长往往会忘记格式。
  2. 更强的安全性: 当黑客试图诱骗模型忽略其规则(提示注入)时,CALYREX 模型更难被愚弄。与标准模型相比,它显著更好地抵抗了“多轮越狱”(即黑客重复多次不良指令)。
  3. 无记忆丢失: 由于他们保持 AI 的主要“大脑”冻结(不变),仅训练新的“对讲机”,模型没有忘记如何做数学题或回忆事实。它在获得更好纪律性的同时保留了其智能。

局限性(注意事项)

该论文诚实地指出了这种方法并非完美无缺的地方:

  • 复杂格式: 如果任务需要生成模型未曾训练过的非常复杂的新类型代码或 JSON 结构,“对讲机”的作用就不如完全重新训练整个模型那么大。
  • 特定攻击: 虽然它阻止了许多类型的违规,但它并没有神奇地修复每一种安全攻击,特别是如果“规则手册”本身没有针对该攻击的具体规则时。

总结

CALYREX 是一种构建 AI 的新方法,它将“系统规则”视为一种独立的、具有特权的信号,而不仅仅是句子中的另一个单词。通过在 AI 处理步骤的最末端放置一个特殊的“签到”机制,它确保即使用户试图混淆或欺骗 AI,AI 也能记住其规则。这就像在 AI 开口说话之前,给它一个永久的、不可擦除的工作职责提醒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →