← 最新论文
💬 NLP

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard 是一个开源的、以推理为中心的护栏模型家族,通过提供具有结构化解释的可解释、多维度风险评估,以及一种平衡效率与策略适应性的灵活分层推理范式,来增强大语言模型的安全性。

原作者: Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、有创造力的助手(一个大型语言模型),它能写故事、解数学题,还能与任何人聊天。但由于这个助手思想非常开放,它有时会无意中说出一些无礼、危险或非法的内容。为了保持安全,我们通常会在门口安排一名“保安”来检查发出的每一条消息。

如今的大多数保安更像是一个拿着清单的严格安保人员。他们查看一条消息,然后根据记忆中的固定规则快速喊出“安全!”或“不安全!”。如果一条消息没有完全符合他们的清单,他们可能会漏掉危险,或者误拦无害的内容。他们也无法解释自己为什么做出这样的选择;他们只能给出一个“是/否”的答案。

YuFeng-XGuard 是由阿里巴巴设计的一种新型保安。它不再只是简单地喊“停”,而是更像一个细心的侦探,会撰写一份报告。以下是它的工作原理,通过简单的拆解来理解:

1. 是侦探,而不只是保安

YuFeng-XGuard 不仅仅给出“是/否”的答案,它会提供一份结构化的报告

  • 判定结果: 它会明确指出发现了哪种类型的风险(例如,“这是仇恨言论”或“这是危险武器指令”)。
  • 置信度: 它会告诉你它有多确定(例如,“我有 95% 的把握认为这是违规的”)。
  • 推理过程: 它会用通俗易懂的英文写下一段简短的解释,就像侦探在说:“我标记这条消息是因为用户询问了如何制造炸弹,这符合我们关于危险武器的规则。”

这使得人类能够理解决策背后的原因,而不是只看到一个“黑匣子”。

2. “快速通道” vs. “深度挖掘”(分层推理)

想象你在机场。有时你只需要快速核对一下身份证件就能通过闸口;而有时,如果看起来有些可疑,你就需要进行全面的行李检查。

YuFeng-XGuard 兼顾了两者:

  • 快速通道: 它可以在它“思考”出的第一个词时就做出安全决策。这非常快,非常适合那些不希望等待的实时聊天场景。
  • 深度挖掘: 如果你需要了解细节(例如用于审计或审查),它会继续输出并写出完整的解释。只有当你需要时,你才会支付“时间成本”。

3. “变色龙”策略(动态策略)

大多数安全卫士就像雕像:一旦建成,它们的规则就是固定的。如果出现了新类型的危险(比如一种新型诈骗),你必须打破雕像,将其熔化并重建(重新训练模型)才能修复它。

YuFeng-XGuard 则像一只变色龙。它可以即时改变规则,而无需重建。

  • 它是如何工作的: 你可以告诉它:“嘿,今天我们在一家特定的商店,所以我们需要拦截任何关于‘假手表’的内容。”
  • 结果: 它能立即理解这条新规则并应用它,即使它在原始训练中从未见过“假手表”。这意味着公司可以即时更新其安全规则,而无需等待工程师重新训练 AI。

4. 两种尺寸,应对各种任务

团队发布了两个版本的这个侦探:

  • 大侦探 (8B 模型): 一个功能强大的版本,可以处理复杂案例并进行深度推理。
  • 口袋侦探 (0.6B 模型): 一个微型、超快速的版本。它非常小,可以在性能较弱的计算机上运行,但它依然出奇地聪明且准确,在测试中经常击败许多更大的模型。

它表现如何?

该论文使用各种“棘手”的测试(包括多种不同语言的测试以及旨在欺骗 AI 的测试),将这种新型卫士与其他许多安全系统进行了对比。

  • 结果: YuFeng-XGuard 在大多数类别中都名列前茅。它在识别危险方面表现更好,在理解不同语言方面表现更好,并且在避免“过度拦截”(误拦无害消息)方面也做得更好。
  • 效率: 它在保持极高准确性的同时,依然足够快速,能够满足现实世界的使用需求。

总结

YuFeng-XGuard 将安全卫士的角色从一个沉默、僵化的守门人转变为一个透明、适应性强且可解释的合作伙伴。它不仅能阻止坏事,还能准确地告诉你发生了什么、为什么这是一个问题,并让你在世界变化时能够即时更改规则——而无需重建整个系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →