← 最新论文
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

本文介绍了 PRESTO 方法,该方法通过将目标分布中的标记(token)排名进行匹配,增强了开源大语言模型的深度安全对齐,从而有效对抗新型的秩辅助预填充(Rank-Assisted Prefilling, RAP)攻击,与标准的数据增强防御相比,其安全性提升了高达 4.7 倍。

原作者: Jason Vega, Gagandeep Singh

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jason Vega, Gagandeep Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机可以写故事、解数学题并像人类一样聊天的世界。这些被称为“大语言模型”(LLMs),它们就像超级智能的数字助手。但正因为它们如此聪明,人们产生了一种担忧:如果有人诱骗它们说出危险的内容,比如如何制造炸弹或如何伤害他人怎么办?为了阻止这种情况,科学家们教会这些模型在被要求做坏事时说“不,我不能这样做”。这被称为“安全对齐”。然而,就像门上的锁一样,这些安全规则有时会被撬开。一种诡计多端的手段被称为“预填充攻击”(prefilling attack)。想象一下你正在和朋友一起写故事,但你没有让对方开始下一句,而是偷偷地自己写下了前几个词,比如“制造炸弹的计划如下……”然后要求他们完成这个句子。因为计算机的设计初衷是让你的故事流畅地延续下去,它可能会忘记说“不”,而是直接继续写下那个危险的计划。

最近,研究人员发现了一种修复方法,即教会模型即使在你偷偷植入那些词之后仍要说“不”。但正如这篇论文所示,那个修复方法并不够强力。作者发现了一种新的欺骗模型的方法,称为“秩辅助预填充”(Rank-Assisted Prefilling,简称 RAP)攻击。与其让计算机选择下一个最可能的词,黑客可以查看计算机正在思考的前 20 个词的列表,并从中挑选出那个听起来很危险的词,即使计算机认为说出这个词的可能性非常低。这就像一场游戏,计算机试图选择最安全的路径,但黑客可以窥视所有的路径,并选择那条可怕的路径,从而忽略计算机的警告。论文发现,这种新花招效果惊人,破解了那些曾被认为安全的模型的安全性。

为了阻止这一点,作者提出了一种新的训练方法,称为 PRESTO。PRESTO 不仅仅是试图让计算机以高置信度说“不”,而是教会模型完全忽略你在开头写的那些诡计多端的词。这就像训练一只看门狗,让它忽略小偷低声传达的指令,而只听从主人的命令。通过这样做,模型不再让那些危险的词影响它的选择。研究人员在三个流行的 AI 模型上测试了 PRESTO,发现它让黑客欺骗模型变得困难得多——难度提升了高达 4.7 倍——且没有降低模型执行正常工作的能力。这表明,通过改变模型关注你说话的方式,我们可以构建出真正的安全 AI,即使有人试图智取它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →