← 最新论文
🤖 AI

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting

本文提出了一种新颖的方法,将无分布风险控制在动态早退机制相结合,以防止有害上下文将大语言模型的性能降低至零样本基线以下,同时提升在有益输入上的效率与准确性。

原作者: Andrea Wynn, Metod Jazbec, Charith Peris, Rinat Khaziev, Anqi Liu, Daniel Khashabi, Eric Nalisnick

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrea Wynn, Metod Jazbec, Charith Peris, Rinat Khaziev, Anqi Liu, Daniel Khashabi, Eric Nalisnick

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢、成就斐然的助手(大型语言模型,或称 LLM),它极其聪明,但也有些讨好型人格。你给它一个任务,比如“总结这位患者的病历”,并提供一些背景信息(上下文)来协助它。

通常,这些背景信息是有帮助的。但有时,这些背景信息是垃圾。也许病历是由一位疲惫的护士录入的,其中出现了错误;或者有人试图用虚假信息欺骗人工智能。如果人工智能盲目信任这些糟糕的背景信息,它可能会给出危险或错误的回答。这就是“垃圾进,垃圾出”的问题。

本文提出了一种安全系统,旨在防止人工智能在背景信息糟糕时犯错,同时允许其在信息良好时加速运行。以下是他们实现这一目标的方法,借助了一些日常类比:

1. “零样本”基线:人工智能的直觉

首先,研究人员建立了一个“安全基线”。他们问道:如果我们完全不提供任何上下文,这个人工智能会如何回答?

  • 类比:想象你正在参加考试。如果你没有阅读那份令人困惑的学习指南,你就会依赖自己的知识(你的“零样本”能力)。研究人员说:“好吧,让我们将你的‘直觉’回答设为安全底线。我们绝不想让人工智能的表现差于它自己的直觉。”

2. 问题:“过度思考”

该论文发现,当大型语言模型接收到糟糕的上下文时,它们倾向于“过度思考”。

  • 类比:将人工智能的大脑想象成一栋多层建筑。底层是人工智能开始处理信息的地方,顶层则是它进行最终、深度思考的地方。
    • 当上下文良好时,人工智能会一直爬到顶层,答案也会变得更好。
    • 当上下文糟糕(有害)时,人工智能在底层开始时有一个好主意。但随着它向上爬,它被糟糕的信息搞糊涂了,改变了主意,最终在顶层得出了一个糟糕的答案。它把自己“过度思考”进了死胡同。

3. 解决方案:“早退”(电梯)

为了解决这个问题,研究人员给人工智能配备了一部可以在任意楼层停下的“电梯”。

  • 工作原理:当人工智能处理问题时,它会在每一层(每一层网络)检查自己的置信度。
    • 如果上下文有帮助:人工智能会迅速建立信心。它会在较早的楼层停下(比如第 10 层)并给出答案。这节省了时间和能量,因为它不需要一直爬到顶层。
    • 如果上下文有害:人工智能会感到困惑。它可能会在早期对错误的答案建立信心,但系统的设计旨在捕捉这种情况。如果人工智能试图在“糟糕”的上下文中钻得太深,系统就会说:“停下!你过度思考了。”

4. 安全网:“风险控制”规则

人工智能如何知道何时停止?它们使用一种称为**无分布风险控制(DFRC)**的统计规则。

  • 类比:想象一位严厉的管理者(风险控制者)设定了一条规则:“你可以使用学习指南,但最终成绩不能比没有指南时的成绩低超过 5%。”
  • 人工智能会测试不同的“停止点”(电梯楼层),以找到完美的位置。
    • 如果上下文糟糕,人工智能会提前停止;或者如果找不到安全点,它便完全忽略上下文,直接给出其“直觉”(零样本)答案。
    • 如果上下文良好,人工智能会提前停止以节省时间,同时仍能给出出色的答案。

5. “魔术”:处理负分

这里存在一个技术障碍。通常,安全规则只处理“坏分数”(如错误)。但在这里,当上下文有帮助时,人工智能可能会获得“好分数”(负损失)。

  • 类比:想象一个记分板,错误是正数(+10),而好的回答是负数(-10)。标准的安全规则只知道如何限制正数。它们会意外地将“好回答”(-10)变成零,导致人工智能误以为它从有帮助的上下文中没有任何收获。
  • 论文的解决方案:作者发明了一种新的数学技巧(风险转换)来重新调整记分板。这使得他们能够将“好回答”保留为负数,同时仍能应用安全规则。这确保了人工智能不会变得过于保守,从而错失良好上下文带来的益处。

结果

通过结合这些想法,该论文表明:

  1. 安全性:即使你向人工智能提供糟糕、具有误导性的信息,它的表现也绝不会差于它自己的直觉。
  2. 速度:当信息良好时,人工智能会提前停止,从而节省大量的计算能力(在某些情况下,处理的层数可减少高达 80%)。

简而言之,他们为人工智能构建了一部“智能电梯”,它知道何时停止攀爬以避免落入陷阱,同时也知道在路径清晰时何时走捷径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →