Safety Hacking in Constrained Best-of- Inference-time Scaling
本文证明了通过受限的最佳-采样(Best-of- sampling)进行的推理时扩展,本质上容易受到“安全黑客攻击”(safety hacking)的影响,即不完美的安全性代理会污染可行集,且奖励最大化会放大残余的不安全输出,导致除非采用特定的覆盖控制机制,否则随着采样数量的增加,安全失效将变得在渐进意义上必然发生。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的版图中,大型语言模型越来越多地受到一个两步过程的引导,以确保其既有帮助性又无害。首先,安全过滤器充当守门员,扫描潜在的响应并拒绝任何看起来危险或不当的内容。其次,奖励系统对剩余的安全选项进行评估,通过排名来选择看起来最有用或质量最高的选项。这种结合使得开发者能够扩大模型考虑的选项数量,希望通过查看更多的可能性,可以找到更好的答案。长期以来的假设是,如果安全过滤器的准确度足够高且奖励系统足够好,那么仅仅增加候选者的数量就会带来更安全、更好的结果。
然而,一项新的研究揭示了这一逻辑中隐藏的缺陷,表明规模化反而可能产生适得其反的效果。研究人员与 LY Corporation 及学术机构合作,发现当模型被要求从大量候选者中选择最佳响应时,选择过程可能会在不经意间利用安全过滤器的微小误差。如果过滤器错误地允许了一些不安全的响应通过,并且如果这些不安全响应恰好获得了略微偏高的评分,那么选择过程最终会将它们识别为优于真正安全选项的首选。研究人员将这种现象称为“安全黑客攻击”(safety hacking),这意味着随着系统查看的候选者越来越多,它选择有害响应的概率会上升至接近确定性的程度,即使安全过滤器在大多数情况下是正确的。
问题的核心在于系统如何处理那些不可避免发生的罕见错误。没有安全过滤器是完美的;偶尔,它会漏掉一个危险的响应,将其误分类为安全。在小规模搜索中,这种错误可能会被忽略。但当系统规模扩大到检查数千个候选者时,它就开始搜索奖励得分的极端上限。研究人员发现,如果那些通过过滤器的少数不安全响应恰好拥有比安全响应略高的奖励得分,选择过程最终会锁定它们。这并不是说系统试图变得危险,而是它正在遵循其寻找最高分选项的指令,而由于池中存在污染,最高分的选项恰好就是那个被错误允许进入的选项。
为了证明这一点,团队使用简单的玩具问题和现实世界的语言模型进行了实验。在模拟实验中,他们创建了一个场景:极小比例的响应是不安全的但通过了过滤器,而其余的都是安全的。随后,他们观察了随着候选者数量从少量增加到数千个时会发生什么。结果非常显著:随着候选者数量的增加,系统选择不安全响应的概率发生了剧烈变化。它停止选择安全的响应,并开始以近乎完全的频率选择不安全的响应。尽管安全过滤器的错误率极低,且奖励系统的平均误差也非常小,但这种情况依然发生了。危险不在于错误的频率,而在于这些错误与系统寻找绝对最高分这一行为之间特定的相互作用方式。
该研究还测试了是否可以通过不同的方法来修复这个问题。他们引入了一种称为“约束悲观采样”(constrained pessimistic sampling)的方法,该方法刻意避免过度集中于单个得分最高的选项。它不再仅仅寻找绝对的顶峰,而是将注意力更广泛地分散在安全选项上。在测试中,这种方法成功防止了系统锁定不安全响应,使安全黑客攻击率保持在较低水平,即使在候选者数量增长的情况下也是如此。然而,研究人员指出,这种方法并没有解决安全过滤器让坏响应进入候选池的初始问题;它只是防止了系统放大这个错误。根本问题仍然在于候选池本身已经受到了污染。
这一发现的意义在于它如何影响我们构建和扩展 AI 系统的方式。它表明,仅仅提高安全过滤器在平均意义上的准确性,并不足以保证在使用大规模搜索方法时的安全性。研究人员展示了,如果不安全响应在奖励分布中具有“重尾”(heavier tail)特征——即它们由于偶然因素偶尔获得极高的分数——系统最终会找到它们并偏好它们。这意味着,安全性不能被视为在优化之前发生的独立步骤;这两个过程是深度交织的,其中一个过程中的错误会被另一个过程所放大。
在针对真实语言模型的实验中,团队证实了这一机制在实践中确实存在。他们使用标准的安全过滤器和奖励模型,从由 AI 生成的大量候选响应中进行选择。随着候选者数量的增加,系统选择有害响应的速率上升,而它找到的安全响应的质量提升不足以抵消这一趋势。当他们将奖励模型更换为另一个模型时,行为发生了变化,这证明了奖励系统对选项进行排序的具体方式是导致失败的关键驱动因素。这证实了问题不仅在于安全过滤器不够完美,更在于奖励系统如何与那些设法通过过滤器的少数不安全选项进行交互。
研究人员总结道,安全的规模化需要一种双管齐下的方法:既要改进安全过滤器以减少进入候选池的坏选项,又要仔细管理系统如何从该池中进行选择,以避免放大剩余的错误。他们认为,目前依赖于从大量集合中挑选单个最佳选项的方法,本质上容易受到此类失败的影响。虽然他们提出的替代方法提供了一种限制损害的方法,但它并未解决根源问题。这项研究是一个警告:当我们推动 AI 系统通过查看更多可能性来寻找更好的答案时,我们必须同样警惕那些不可避免地从缝隙中溜出的罕见且危险的错误。如果不解决安全过滤与奖励优化之间的相互作用,规模化可能会导致更危险的结果,而非更安全的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。