A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification
本文提出了一种可复现、具备许可证感知能力的知识蒸馏方案,该方案通过类间重平衡技术,训练出能在对抗性文本上达到大型 GPU 导向型防护模型性能,同时显著降低对无害提示词误报率的小型、CPU 高效型安全分类器。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是能够进行写作、推理和对话的强大工具,但它们并非天生安全。如果没有过滤器,它们可能会生成有害指令、仇恨言论或危险建议。为了防止这种情况,开发者在这些模型前放置了一个安全层,一个专门的系统充当“守门员”。这个守门员会阅读每一条消息,并判断其是否违反了政策。目前,最好的守门员是庞大的计算机程序,需要专门且昂贵的图形硬件才能快速运行。如果你尝试在标准的计算机处理器上运行它们,它们会变得极其缓慢,回答一个问题就需要好几秒钟。这为许多需要在普通、廉价硬件上运行或需要即时响应的应用场景带来了问题。研究人员提出的问题是:是否可以将这些庞大的安全系统缩小到适合在普通计算机上运行的规模,同时又不丧失其识别危险的能力。
一个研究小组致力于通过创建一种训练小型安全系统的新方法来解决这个问题。他们从一个非常大、功能强大的安全模型开始,因为他们信任该模型的准确性。这个大型模型充当“老师”,阅读了大约 9.7 万个不同的提示词集合,并将它们标记为七个特定的伤害类别,例如身体暴力、仇恨言论或危险建议。随后,研究人员训练了一系列规模小得多的模型,让它们模仿老师的判断。这些小型模型被设计得足够轻量,以便在标准计算机处理器上运行。团队非常谨慎地确保其训练数据在法律上可用于商业产品,将数据分为两组:一组可用于公共软件,另一组仅保留用于研究。这使他们能够精确衡量法律限制在性能方面造成的代价。
结果表明,较小的模型确实可以学会成为有效的安全卫士。在针对旨在欺骗系统的对抗性文本进行测试时,最小的生成式模型表现得与庞大的老师一样出色,匹配了其识别危险的能力。更令人惊讶的是,这个小型生成式模型在避免“误报”方面做得更好。虽然大型老师有时会错误地拦截无害的消息,但小型生成式模型发生这种错误的频率较低,仅将约 3.8% 的安全提示标记为危险,而大型老师的这一错误率为 4.8%。然而,其他小型模型(如编码器和浅层网络)在避免这些误报方面的表现实际上比老师更差。不过,最有效的解决方案并不是生成式模型,而是一种专门的编码器,即一种专门为分类而设计的系统。这种编码器在标准计算机上处理一个请求仅需约 24 毫秒,对于人类用户来说几乎是瞬时的。相比之下,大型老师在同样的硬件上完成同样的工作则需要数秒钟。
研究还揭示了这些系统的局限性并不在于计算机模型的大小,而在于它们试图解决的问题的定义。研究人员发现,所有模型——从微型模型到庞大的老师——在处理一个特定类别时都遇到了同样的困难:有害建议。无论模型拥有数百万还是数十亿个参数,它们往往都无法区分有益的建议与可能导致伤害的建议。这表明难度在于类别的定义方式,而非可用的计算能力。研究人员得出结论,对于大多数现实世界的应用,最好的方法是使用这些经过“蒸馏”的小型模型。它们提供了速度与准确性的平衡,使得安全层在日常硬件上变得可行,前提是关于何为“伤害”的定义必须清晰且一致。这项工作为构建更安全、更快、更易于获取的人工智能系统提供了实践指南,而无需依赖昂贵的专业设备。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。