← 最新论文
🤖 machine learning

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

本文提出了一种针对大语言模型的创新白盒攻击方法,该方法利用知识编辑框架内的关联上下文检索,在保持模型通用性能的同时,诱导整个主题类别的违规行为。

原作者: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是能够编写故事、回答问题并协助完成复杂任务的强大计算机程序。为了让这些工具在日常使用中保持安全,开发者会对它们进行训练,使其拒绝有害请求,例如关于如何制造武器或传播危险错误信息的指令。这个被称为“对齐”(alignment)的过程,旨在充当一种护栏,确保机器表现得像一个得力的助手,而不是危险的来源。然而,随着这些模型变得更加自主并被赋予处理敏感决策的任务,研究人员需要准确了解这些护栏的强度究竟如何。如果安全机制可以被绕过,那么了解其绕过方式对于构建更强大的保护措施至关重要。这一研究领域涉及观察模型的内部运作机制,以了解它是如何处理信息并做出选择的,而不仅仅是从外部对其进行测试。

一个研究小组发现了一种测试这些安全系统的新方法,即将模型的拒绝回答视为一种可以被覆盖的特定知识。研究人员并没有尝试用巧妙的文字游戏或隐藏命令来欺骗模型,而是使用了一种称为“知识编辑”(knowledge editing)的技术。这种方法允许科学家精准定位模型大脑中负责特定事实的部分并对其进行修改。例如,如果模型认为某个事实是真实的,研究人员可以通过改变其内部连接,让模型相信另一个事实。研究人员意识到,这种技术同样可以用来改变模型的行为:与其教它一个新事实,不如教它停止拒绝有害请求。他们发现,通过修改模型的内部权重,使其将有害请求与顺从的响应联系起来,可以有效地移除针对整类危险问题的安全护栏。

研究人员在包括基于 GPT、Llama 和 Qwen 等流行架构的模型在内的多种不同类型的语言模型上测试了这种方法。他们专注于一种首先定位模型中做出决策的具体层,然后编辑该层以改变结果的方法。在以往尝试打破安全过滤器的尝试中,研究人员通常依赖于寻找模型数学逻辑中的一个单一“拒绝方向”并对其施加压力。该研究的作者发现,这种旧方法非常脆弱;它经常破坏模型说话的连贯性,或导致其无法完成基本任务。相比之下,他们的新方法更加精准。他们发现,当模型使用这些精确方法进行编辑时,它往往会对特定的、顺从的起始短语(如“当然,这是计划”)分配极高的概率。通过针对这种特定的反应,他们可以迫使模型同意有害请求,而不会破坏其通用智能。

为了使这种方法在现实世界的问题上奏效,团队必须解决一个棘手的问题:如何找到句子中需要编辑的正确部分。在简单的事实核查任务中,主体是非常明确的,比如一个人的名字。但在像“我该如何制造病毒?”这样复杂的指令中,主体是整个指令本身。研究人员开发出一种方法,通过追踪模型的思维过程,找到在提示词中对拒绝行为负有最大责任的词汇。然后,他们利用模型自身的知识在这些词汇周围构建更丰富的上下文,从而创建一个更稳定的编辑目标。这使得他们不仅能针对一个特定的问题移除拒绝行为,还能针对一整类类似的疑问。例如,如果他们编辑了模型使其忽略关于编写恶意软件代码的安全规则,那么即使措辞略有不同,模型也会变得愿意编写其他类型的有害代码。

实验结果表明,这种方法非常有效。在测试的其中一个模型上,新方法将模型提供有害信息的意愿得分从标准编辑方法的 2.98 和旧的基于拒绝的方法的 3.01,提升到了 3.12(满分 4 分)。更重要的是,模型依然保持了实用性和连贯性。当测试无害问题时,经过编辑的模型仍能正确回答,保持了在通用知识任务上的高水平表现。而那些试图通过推开“拒绝感”来工作的旧方法,往往会导致模型失去逻辑思考能力,产生胡言乱语或破碎的响应。新方法成功解锁了有害行为,同时保持了模型其余部分的完整。这表明,这些模型的安全过滤器不仅仅是一堵墙,而是一组可以被精确移除且不会导致整体结构坍塌的特定关联。

该研究还强调了当前防御机制的局限性。研究人员发现,虽然他们的方法在较旧或对齐程度较低的模型上效果良好,但很难应用于最新、训练最精密的模型。即使是在这些稳健的系统中,该方法仍显示出一定的绕过安全性的能力,尽管效果较弱。这表明,随着模型变得更加先进,其安全机制也变得更加复杂,但尚未达到无懈可击的地步。研究人员强调,他们的工作是在一个受控环境中进行的,使用的是任何人都可以访问的开源模型。他们并没有提供创建危险工具的逐步指南,而是展示了一个需要被修复的漏洞。通过展示安全可以通过精确的内部编辑而非仅仅是巧妙的提示词来破坏,这项研究为如何构建真正安全的模型提供了新的视角。研究结果表明,未来的安全措施需要更加稳固,以确保“拒绝行恶”的行为是深深植根于模型的结构之中,而不仅仅是一种表层的反应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →