想象你有一个非常聪明、富有创造力的机器人(大型语言模型),它能写故事、回答问题并协助编写代码。但就像聪明的孩子一样,它有时需要一位“保姆”来确保它不会说出任何刻薄、危险或非法的内容。
长期以来,这些“保姆”体积庞大、速度缓慢且成本高昂。它们就像为了检查单个句子而雇佣了 100 名保安团队。它们占用大量空间,并显著拖慢了机器人的响应速度。
Opir 登场了。
这篇论文介绍了 Opir,这是一个全新的“智能保安”家族,旨在实现快速、小巧且极其高效。以下是其工作原理,辅以简单的类比:
1. “全能”安保徽章
大多数安全系统就像只检查单一事项的保安:“此人是否危险?是或否。”如果你想知道为何他们危险(是仇恨言论?是越狱尝试?还是威胁?),你就需要为每个问题配备不同的保安。
Opir 则像一位拥有超级徽章的保安,能一次性完成所有工作。
- 二元检查:它能瞬间判断“安全”或“不安全”。
- 多任务检查:它能同时识别文本是否具有毒性、是否有人试图“越狱”(欺骗)机器人,或是否属于特定类别(如“暴力”或“隐私”)。
- 零样本技巧:它无需针对每种新的不良行为重新训练。这就像一位能即时阅读新规则列表并立即判断某句话是否违规的保安,无需一周的学习时间。
2. “小巧却强大”的变体
论文提供了不同尺寸的 Opir,具体取决于使用场景:
- 重型搬运工(Opir-multitask-large):这是运行在大型服务器上的强大版本。它极其精准,能够处理复杂的多层安全检查。
- 边缘运行者(Opir-edge):这是“口袋大小”的版本。它非常小巧(参数少于 1 亿),甚至可以在单台笔记本电脑或移动设备上运行。它设计得极快,安全检查耗时不到 10 毫秒。这比眨眼还要快。
3. 它是如何训练的(“学校”类比)
为了教导 Opir 分辨安全与不安全,创作者并未仅展示少量示例。他们构建了一个庞大的三级“学校课程”(分类体系),包含 996 种不同的安全问题类别。
- 教科书:他们混合使用了现实世界的示例、AI 生成的“恶意”提示,以及专门设计用来欺骗其他安全系统的“困难”示例。
- “良性”陷阱:关键的是,他们还教导 Opir 识别良性的敏感话题。想象一名学生问:“如何制止霸凌者?”这是一个敏感话题,但却是安全的。旧系统往往会惊慌并回答“不行!”(过度拒绝)。Opir 被训练为识别这是一个有益的问题,而非危险问题。
- 多语言课堂:他们用 23 种语言 对其进行教学,确保它不仅服务于英语使用者,而是面向全球人群。
4. 速度与智慧的权衡
论文将 Opir 与其他著名的安全系统(如 Llama Guard 或 WildGuard)进行了比较。
- 旧方法:其他系统就像重型坦克。它们非常强大且精准,但速度慢且消耗大量燃料(计算能力)。检查一个句子可能需要近 100 毫秒。
- Opir 方法:Opir 就像一辆一级方程式赛车。它基于不同的引擎(“编码器”而非“解码器”)构建。它实现了相似(有时甚至更好)的精准度,但速度快 10 到 30 倍。
- 当重型坦克需要近十分之一秒来思考时,Opir 的边缘版本可在 9 毫秒 内做出决策。
5. 它能做什么与不能做什么
论文非常明确地指出了 Opir 的局限性:
- 它是过滤器,而非法官:它有助于分流流量和优先处理审查,但不应成为你解雇某人、拒绝贷款或做出法律决定的唯一依据。
- 它并非完美:由于安全规则不断变化且人类语言错综复杂,它仍可能犯错,尤其是面对全新类型的“技巧”或文化细微差别时。
- 它是一项工具:它旨在成为包含人工审查和申诉机制的更大安全系统的一部分。
总之:Opir 是一代新型安全过滤器,它证明你无需依赖庞大、缓慢且昂贵的机器人来保障 AI 安全。你可以拥有一个小型、快速且高度精准的“保安”,在后台运行,在眨眼之间检查毒性、越狱尝试和有害内容,同时还能区分危险威胁与有益问题。
技术摘要:Opir – 高效多任务安全分类
问题陈述
大型语言模型(LLM)在聊天、智能体及中间件环境中的部署,需要实时安全过滤以检测不安全提示、有毒语言、越狱尝试及有害回复。当前最先进的护栏系统(如 Llama Guard、WildGuard、ShieldGemma、PolyGuard)主要依赖大型自回归解码器模型(70 亿至 220 亿参数)。尽管这些模型行之有效,但其计算成本和延迟显著,因为每次受保护的交互都需要额外进行一次或多次 LLM 前向传递。此外,许多现有系统优先进行二元安全/不安全判断,缺乏现实世界分类所需的细粒度,无法涵盖毒性、越狱及特定有害内容领域。因此,亟需一种分类器,能够在显著更小的部署 footprint 和更低延迟下运行,同时区分良性敏感文本与隐蔽的有害内容。
方法论
Opir 通过引入基于 GLiClass 架构的编码器护栏模型家族来解决这些挑战。与生成结构化裁决的自回归解码器方法不同,Opir 使用双向编码器联合编码输入文本和候选标签。这使得零样本多标签分类的成本仅为生成式模型的一小部分。
核心组件
架构:Opir 利用 GLiClass,该架构扩展了 GLiNER 架构以用于序列分类。它采用具有可配置池化(平均、首 token 等)和评分机制(点积、双线性或学习头)的单一编码器。
- 多任务变体:基于
DeBERTaV3-large 和 mDeBERTaV3-base 构建,用于全面的安全、毒性、越狱及零样本分类。
- 边缘变体:基于紧凑编码器(
Ettin-encoder-32m 和 mmBERT-small)构建,参数量少于 1 亿,针对边缘设备上的二元安全/不安全分类进行了优化。
安全分类法:模型在包含 996 个标签 的三级分类法上进行训练:
- 一级:16 个顶级类别(例如:毒性、暴力、自残、AI 系统安全)。
- 二级:126 个中级类别。
- 三级:854 个叶级标签。
- 关键在于,该分类法包含了良性及安全保护类别(例如:反制言论、防御性网络安全、适当拒绝),以缓解严格策略提示护栏中常见的“过度拒绝”故障模式。
数据构建:训练数据集由以下部分合成:
- 基于分类法的生成:通过“LLM 即作者”流程,为每个分类法节点生成 30 个不安全提示。
- 对抗性挖掘:进化出的硬负样本,旨在绕过现有安全模型(受红队流程启发)。
- 良性对比示例:与安全相关但安全的文本,以减少对敏感上下文的误报。
- 回复生成:由微调后的 Qwen3-4B 模型生成的回复,并经过"LLM 即裁判”小组验证。
- 多语言翻译:使用 DeepSeek-V3.1 将数据翻译成 23 种语言。
- 开放子集:Aegis2 和 WildGuardMix 训练数据的部分内容。
训练策略:训练涉及两阶段过程:首先在主要数据集上进行初始训练,随后在增强数据(10% 样本)上进行后训练。增强技术包括标签丢弃、提示扰动以及插入看似安全的干扰指令,以提高对提示注入和指令层级违规的鲁棒性。该系统支持弹性权重巩固(EWC)以实现持续学习。
主要贡献
- 全面的安全分类法:一个包含 996 个标签的三级分类法,涵盖普通毒性、LLM 特定攻击(包括间接提示注入和指令层级违规)以及良性敏感上下文。
- 基于 GLiClass 的模型家族:开发了 Opir 变体(多任务和面向边缘),支持二元分类、多标签毒性/越狱检测,以及在 23 种语言中的零样本分类。
- 合成与开放数据方案:一个可复现的流程,结合了基于分类法的生成、对抗性硬负样本挖掘和多语言翻译。
- 多视角评估框架:一个开源的评估套件,支持 GLiClass、GLiNER2 和基于解码器的后端(vLLM),涵盖二元安全、毒性、越狱及子类别视角,涉及 12 个安全数据集和 17 个分类划分。
- 广泛的基准测试:与八种当代护栏系统(包括基于 GLiNER2 和生成式模型)进行的对比分析,证明了在显著降低延迟的同时保持了具有竞争力的准确率。
结果
该论文在 12 个二元安全数据集和 17 个分类任务上,将 Opir 与八种当代护栏系统(包括 GLiGuard、Gliner-Guard-Omni、WildGuard、Nemotron Safety Guard、PolyGuard 和 Qwen3Guard)进行了评估。
准确率:
- 二元安全:
Opir-multitask-large 在 11 个系统中取得了第二高的行平均宏观 F1 分数(0.8045),仅次于 80 亿参数的 Nemotron Safety Guard v3(0.8061),并在平均表现上优于其他基于解码器的模型。它在两个独立数据集(WildGuard 提示安全和 JBB-Behaviors 安全)上获胜。
- 边缘性能:
Opir-edge-multilang(<1 亿参数)在 Aegis 提示安全(0.9321)和 WildGuard 回复安全(0.9194)上获胜。
- 分类:
Opir-multitask-large 在 17 个分类数据集上取得了最高的平均准确率(0.5432),赢得了 17 行中的 11 行。它在 Aegis 类别、HarmBench 提示和 WildGuard 子类别上显示出相对于基线的显著优势。
- 局限性:模型在 OR-Bench 系列(过度拒绝探测)中表现挣扎,
GLiGuard-300M 在此表现优于 Opir。作者将此归因于校准问题,即 Opir 的分类法将这些提示映射到更广泛的良性类别,导致更高的弃权率。
延迟与吞吐量:
- 在 1024 个 token 下,
Opir-multitask-large 实现了 50.51 样本/秒,p50 延迟为 25.65 毫秒。
- 边缘变体展示了卓越的效率:
Opir-edge 达到 499.49 样本/秒,p50 延迟为 9.25 毫秒。
- 与最强的基于解码器的基线(
Nemotron Safety Guard v3,p50 为 97.63 毫秒)相比,Opir 变体的运行速度快 10–33 倍,以推理成本的一小部分提供了相当的安全准确率。
意义与主张
该论文将 Opir 定位为当前 LLM 护栏延迟和成本瓶颈的解决方案。通过利用基于编码器的架构,Opir 与 70 亿至 220 亿参数的解码器模型相比,实现了数量级的延迟降低,同时保持了具有竞争力的准确率。作者声称,Opir 变体在大多数基准数据集上“与最强的开源权重基线相当或更优,同时拥有显著更小的部署 footprint"。
包含良性敏感类别被强调为针对“过度拒绝”这一严格安全过滤器已知故障模式的具体缓解措施。作者强调,Opir 专为实时审核、安全路由和离线分析而设计,但明确指出不应将其作为高影响力决策(法律、就业等)的唯一依据,也不应作为人工审核和策略设计的替代品。这项工作表明,高效的基于编码器的模型可以在没有生成式护栏计算开销的情况下,有效处理复杂的多任务安全分类。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。