CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment
本文介绍了 CHILLGuard,这是一种细粒度的中文大语言模型安全护栏,它通过可扩展的多阶段构建流水线解决了高质量标注数据稀缺的问题,并通过在大规模、经过严格筛选的数据集上进行模型感知偏好对齐,实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、乐于助人的机器人助手(大语言模型),它能写故事、回答问题并协助工作。但就像任何强大的工具一样,如果观察不周,它可能会在说话时(尤其是在说中文时)无意中表达出粗鲁、非法或危险的内容。
这篇论文介绍了一个名为 CHILLGuard 的专门化“安全卫士”,旨在专门监督说中文的机器人。以下是他们构建它的过程,通过简单的语言进行了解释:
1. 问题所在:“一刀切”的西装并不合身
现有的机器人安全卫士大多是基于英语训练的。想象一下,试图让一个高大的美国人穿着为不同体型的人量身定制的西装;这套西装在某些地方可能会太紧,而在另一些地方则太松。
- 问题在于: 这些基于英语训练的卫士并不理解中文文化、特定的法律,以及人们在中文里隐藏恶意意图的巧妙方式(例如使用谐音、表情符号或历史典故,在不直接说出坏词的情况下表达有害内容)。
- 结果: 它们经常会漏掉危险内容,或者错误地标记无害的内容。
2. 解决方案:一套定制的防护服
作者构建了一个由三个主要部分组成的新型安全系统:
A 部分:规则手册(分类法)
首先,他们编写了一本专门针对中文安全的详细规则手册。他们没有仅仅简单地定义“坏”或“好”,而是创建了一个包含 31 个特定类别的五星级评分系统。
- 5 大核心类别:
- 国家价值观: 保护国家的稳定与法律。
- 公平性: 防止基于种族、性别或职业的歧视。
- 商业规则: 防止诈骗、盗取创意或不正当的商业手段。
- 个人权利: 保护个人的隐私、名誉和安全。
- 服务质量: 确保机器人不会提供无用或违背科学常识的建议。
B 部分:训练健身房(数据构建)
为了教导这个卫士,他们需要一个庞大的示例库。但高质量的“坏”中文提示词很难找到。因此,他们建立了一个三阶段工厂来创造它们:
- 寻宝游戏 (RAG): 他们在真实互联网上搜索与 31 个类别相关的关键词,并抓取真实的文本样本。
- 现实世界: 他们收集了中国真实用户向商业机器人提出的实际问题。
- “骗子”工厂 (提示工程): 这是最聪明的部分。他们将真实的提问进行处理,并利用 AI 以一种棘手的方式对其进行重写。
- 类比: 想象一名保安正在接受训练。与其只给他们看小偷的照片,不如给他们看一个戴着伪装、说着暗语或躲在笑话背后的骗子。AI 使用同音异义词、历史隐喻和反讽重写了那些坏问题,使它们更难被捕捉。
他们最终得到了 405,000 个训练样本(健身房)和 51,000 个测试样本(期末考试)。
C 部分:训练方法(“陪练伙伴”)
通常,你通过展示示例来训练安全卫士。但本文使用了陪练伙伴的方法。
- 战士 (生成器): 一个经过训练的 AI,旨在创造出最难、最棘手的题目来欺骗卫士。
- 卫士 (分类器): 试图捕捉这些问题的安全模型。
- 共舞: 他们在回合制中共同训练。战士试图欺骗卫士。当卫士失败时,战士会获得奖励;当卫士成功时,它会变得更强。
- 秘诀 (MDPO): 他们使用了一种特殊的技巧,称为模型感知直接偏好优化 (Model-aware Direct Preference Optimization)。
- 类比: 想象一位教练。如果一个学生数学已经很好,教练就不会浪费时间在简单的题目上。但如果学生在某个特定难点上遇到困难,教练就会把额外的精力集中在那里。这种方法会自动调整训练难度,将最多的精力集中在卫士难以回答的问题上。
3. 结果:以优异成绩通过考试
他们用这个新的卫士与其他著名的安全卫士(如 LlamaGuard 和 QwenGuard)进行了对比测试。
- 得分: CHILLGuard 在他们的定制测试中得分显著更高。
- 对比: 它比排名第二的模型高出了很大一截(在他们的主要测试中表现提升了约 16%)。
- 一致性: 与其他在某些主题表现出色但在另一些主题表现糟糕的模型不同,CHILLGuard 在所有 31 个类别中都表现强劲。
总结
作者通过以下方式为 中文 AI 构建了一个定制的安全卫士:
- 创建了一套详细的、具有文化特性的规则手册。
- 制造了数百万个带有隐藏危险的棘手示例用于训练。
- 使用了“陪练伙伴”式的训练方法,将额外的精力集中在最难的问题上。
其结果是,这个卫士在识别中文文本中微妙、隐藏且具有文化特性的危险方面,比以往的模型要出色得多。他们已将其数据和代码开放供他人使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。