Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting
本文提出了一种新颖的方法,将无分布风险控制在动态早退机制相结合,以防止有害上下文将大语言模型的性能降低至零样本基线以下,同时提升在有益输入上的效率与准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢、成就斐然的助手(大型语言模型,或称 LLM),它极其聪明,但也有些讨好型人格。你给它一个任务,比如“总结这位患者的病历”,并提供一些背景信息(上下文)来协助它。
通常,这些背景信息是有帮助的。但有时,这些背景信息是垃圾。也许病历是由一位疲惫的护士录入的,其中出现了错误;或者有人试图用虚假信息欺骗人工智能。如果人工智能盲目信任这些糟糕的背景信息,它可能会给出危险或错误的回答。这就是“垃圾进,垃圾出”的问题。
本文提出了一种安全系统,旨在防止人工智能在背景信息糟糕时犯错,同时允许其在信息良好时加速运行。以下是他们实现这一目标的方法,借助了一些日常类比:
1. “零样本”基线:人工智能的直觉
首先,研究人员建立了一个“安全基线”。他们问道:如果我们完全不提供任何上下文,这个人工智能会如何回答?
- 类比:想象你正在参加考试。如果你没有阅读那份令人困惑的学习指南,你就会依赖自己的知识(你的“零样本”能力)。研究人员说:“好吧,让我们将你的‘直觉’回答设为安全底线。我们绝不想让人工智能的表现差于它自己的直觉。”
2. 问题:“过度思考”
该论文发现,当大型语言模型接收到糟糕的上下文时,它们倾向于“过度思考”。
- 类比:将人工智能的大脑想象成一栋多层建筑。底层是人工智能开始处理信息的地方,顶层则是它进行最终、深度思考的地方。
- 当上下文良好时,人工智能会一直爬到顶层,答案也会变得更好。
- 当上下文糟糕(有害)时,人工智能在底层开始时有一个好主意。但随着它向上爬,它被糟糕的信息搞糊涂了,改变了主意,最终在顶层得出了一个糟糕的答案。它把自己“过度思考”进了死胡同。
3. 解决方案:“早退”(电梯)
为了解决这个问题,研究人员给人工智能配备了一部可以在任意楼层停下的“电梯”。
- 工作原理:当人工智能处理问题时,它会在每一层(每一层网络)检查自己的置信度。
- 如果上下文有帮助:人工智能会迅速建立信心。它会在较早的楼层停下(比如第 10 层)并给出答案。这节省了时间和能量,因为它不需要一直爬到顶层。
- 如果上下文有害:人工智能会感到困惑。它可能会在早期对错误的答案建立信心,但系统的设计旨在捕捉这种情况。如果人工智能试图在“糟糕”的上下文中钻得太深,系统就会说:“停下!你过度思考了。”
4. 安全网:“风险控制”规则
人工智能如何知道何时停止?它们使用一种称为**无分布风险控制(DFRC)**的统计规则。
- 类比:想象一位严厉的管理者(风险控制者)设定了一条规则:“你可以使用学习指南,但最终成绩不能比没有指南时的成绩低超过 5%。”
- 人工智能会测试不同的“停止点”(电梯楼层),以找到完美的位置。
- 如果上下文糟糕,人工智能会提前停止;或者如果找不到安全点,它便完全忽略上下文,直接给出其“直觉”(零样本)答案。
- 如果上下文良好,人工智能会提前停止以节省时间,同时仍能给出出色的答案。
5. “魔术”:处理负分
这里存在一个技术障碍。通常,安全规则只处理“坏分数”(如错误)。但在这里,当上下文有帮助时,人工智能可能会获得“好分数”(负损失)。
- 类比:想象一个记分板,错误是正数(+10),而好的回答是负数(-10)。标准的安全规则只知道如何限制正数。它们会意外地将“好回答”(-10)变成零,导致人工智能误以为它从有帮助的上下文中没有任何收获。
- 论文的解决方案:作者发明了一种新的数学技巧(风险转换)来重新调整记分板。这使得他们能够将“好回答”保留为负数,同时仍能应用安全规则。这确保了人工智能不会变得过于保守,从而错失良好上下文带来的益处。
结果
通过结合这些想法,该论文表明:
- 安全性:即使你向人工智能提供糟糕、具有误导性的信息,它的表现也绝不会差于它自己的直觉。
- 速度:当信息良好时,人工智能会提前停止,从而节省大量的计算能力(在某些情况下,处理的层数可减少高达 80%)。
简而言之,他们为人工智能构建了一部“智能电梯”,它知道何时停止攀爬以避免落入陷阱,同时也知道在路径清晰时何时走捷径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。