← 最新论文
💻 computer science

LMSM: LLM Security Framework Inspired by Linux Security Modules

本文介绍了 LMSM,这是一种受 Linux 安全模块启发的针对大语言模型的安全框架,它通过将基于可解释性的检测、策略评估和输出执行进行解耦,从而实现灵活且可组合的安全规则,同时以极小的吞吐量影响显著降低攻击成功率。

原作者: XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型已不再是那种回答完问题就消失的简单工具。在现实世界中,它们是复杂服务的引擎,不断地将用户指令、对话历史和外部信息编织在一起,以构建响应。从用户的提示词到最终答案的这段旅程是一个漫长且具有状态性的路径,而模型仅仅是其中的一个组件。正因为这条路径如此复杂,它也成为了安全失效发生的地方。一个巧妙的提示词技巧可能会绕过安全过滤器,或者检索文档中的隐藏指令可能会诱导模型忽略其规则。为了阻止这种情况,开发者构建了多层防御:他们训练模型变得安全,限制模型所见的内容,并在输出到达用户之前对其进行扫描。然而,这些层级往往是孤立运作的。当研究人员开发出一种新的窥探模型“思维过程”的方法以捕捉不良行为时,他们通常必须围绕该特定发现构建一套全新的、定制的安全系统。这造成了一种防御碎片化的局面,即每一种新工具都需要一次新的集成,而不是一个能够应对任何新威胁的单一、强大的盾牌。

来自新加坡国立大学和中国科学技术大学的研究小组提出了一种不同的方法,其灵感来源于计算机操作系统数十年来处理安全的方式。他们将这一框架称为 LMSM,即语言模型安全模块(Language Model Security Modules)。其核心思想是将“监测危险的任务”与“决定如何应对的任务”分离开来。想象一个安全系统,其中传感器、规则手册和保安是三个截然不同且可互换的部分。在这个新系统中,“传感器”是各种观察模型内部是否存在问题迹象的方法。“规则手册”是一套灵活的指令,规定了这些迹象意味着什么以及何时采取行动。“保安”则是最终的把关者,负责在响应被批准前将其拦截。这种设计意味着,如果研究人员明天发明了一个更好的传感器,或者如果一家公司需要针对特定行业更改其规则,他们可以更换其中的新部件,而无需重建整个安全系统或重写处理模型输出的代码。

研究人员构建了这个系统的原型,以测试它在现实世界使用中混乱且快速变化的环境下是否能够经受住考验。他们在流行的语言模型 Qwen3-4B 上进行了测试,该模型运行在能够同时处理大量请求的高性能服务器上。在这种环境下,请求会被不断地重新调度以提高系统速度,这往往会干扰那些期望固定顺序的安全工具。团队发现,该框架成功地追踪了每一个请求,确保了一个用户做出的决策不会意外影响到另一个用户,即使系统在不同的处理槽位之间移动请求时也是如此。他们使用了不同类型的内部传感器进行测试,包括一些预制的传感器和一些专门为特定任务训练的传感器。系统能够无缝处理所有这些传感器,证明了传感器、规则与执行闸门之间的分离确实按预期工作。

结果表明,这种模块化方法不仅在理论上是成立的,而且在实践中也是有效的。当研究人员使用他们的系统来拦截有害输出时,攻击成功率从接近 40% 大幅降低到了仅 3% 以上。这是一个巨大的进步,意味着系统捕捉到了几乎所有的恶意尝试。然而,像任何安全措施一样,它并不完美;它偶尔会错误地拦截无害的请求,误报率从 2% 轻微上升到了 4%。研究人员指出,这种权衡是可以接受的,并且远比让有害内容通过要好得多。至关重要的是,该系统在不显著降低服务速度的情况下完成了这项工作。即使在同时运行 32 个活跃请求时,该系统仍保持了无安全检查版本近 99% 的速度。这表明,安全检测带来的沉重负担并不一定会以牺牲性能为代价。

这项工作的特别意义在于它如何改变了安全与模型改进之间的关系。此前,每当发现一种新的检测不良行为的方法时,都需要构建一套全新的、定制的安全栈。有了这个框架,新的检测方法可以作为简单的更新插件接入。研究人员展示了他们可以更换一种类型的传感器,或者改变系统检查问题的时机,而无需触动管理模型输出的底层代码。这种灵活性使组织能够快速适应新威胁或特定的法律要求,而无需重新训练庞大的模型或重写整个基础设施。该框架本质上是将语言模型复杂的内部信号转化为可靠、标准化的证据流,并由一个一致且值得信赖的把关者进行处理。

这项研究证实,构建一个位于模型运行时内部、在单个词汇释放给用户之前监控其内部状态的强大安全层是可能的。通过将危险检测、行动决策和拦截行为视为独立的、可互换的组件,研究人员创建了一个既强大又灵活的系统。实验表明,这种方法可以大幅降低有害输出的风险,同时保持服务的快速响应。它提供了一条前进的道路,即通过快速演进的模型分析技术来保护用户,而无需对支撑它们的系统进行持续且昂贵的重新工程化。这项工作表明,人工智能安全的未来可能不在于建造更大、更僵硬的围墙,而在于创造更聪明、更灵活的闸门,使其能够随着所保护的技术一起进化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →