← 最新论文
💻 computer science

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy

GLiNER Guard(GLiGuard)是一个统一的编码器家族,能够在单次前向传播中同时执行安全分类和 personally identifiable information(PII)检测,为生产环境中的大型语言模型系统提供了一种高吞吐量、低延迟且成本效益高的传统自回归审核模型的替代方案。

原作者: Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你经营着一座庞大而繁忙的数字城市,人们(用户)在这里与巨型、超级聪明的机器人(大语言模型)交谈,以获取答案、撰写故事或解决问题。在这些对话抵达那些大机器人之前,它们必须通过一个安全检查站

这个检查站有两项至关重要的工作:

  1. 安全卫士:阻止坏人试图黑客攻击系统、欺骗机器人或发表恶毒言论。
  2. 隐私卫士:在个人秘密(如信用卡号、家庭住址或电话号码)泄露之前,识别并将其隐藏。

问题:“慢巨人”与“快嗅探器”的抉择

直到如今,城市规划者不得不在两种类型的守卫之间做出选择,而两者都不完美:

  • 慢巨人(自回归模型):这些就像受过高等教育、仔细研读请求中每一个单词并深入思考上下文的巨型安全守卫。它们在捕捉不良内容方面极其准确,但雇佣它们既缓慢又昂贵。如果每秒有数百万人试图进入城市,雇佣足够多的这些巨人来检查每个人,会让城市破产并造成大规模的交通堵塞。
  • 快嗅探器(轻量级编码器):这些就像经过训练、能快速嗅探特定气味(如“有毒词汇”或“电子邮件地址”)的敏捷猎犬。它们快速且廉价,但视野狭窄。由于它们没有进行足够深入的“思考”,可能会漏掉巧妙的诡计,或无法识别复杂的个人秘密。

解决方案:“超级嗅探器”(GLiNER Guard)

本文的作者 HiveTraceLab 构建了一种新型守卫,名为GLiNER Guard(GLiGuard)。你可以将其想象为一个既能像侦探一样思考,又能像嗅探器一样工作的超级嗅探器,合二为一

GLiGuard 不需要同时雇佣一个慢巨人和一个快嗅探器(这需要两次独立的检查),而是在单次闪电般的通行中同时完成这两项工作

以下是它们的构建方式:

  • 大脑:他们采用了一个智能、紧凑的大脑(基于名为 GLiNER2 的模型),并训练它同时寻找两件事:“这个请求是否危险?”以及“其中是否包含秘密?”
  • 变体:他们为不同需求构建了该守卫的三个版本:
    1. 紧凑守卫(Uni/Bi-Encoder):一个微小、超快的版本,专为处理大规模人群而设计。它极其高效,在单个计算机芯片上每秒可检查近 200 人,且几乎零延迟。
    2. 全能守卫(Omni Guard):一个稍大、更聪明的版本。它比紧凑版稍慢,但在理解复杂情况方面表现更佳,并且能够适应新的、奇怪的规则,而无需从头重新训练。

结果:速度与智慧的结合

该论文在模拟城市(使用 Aegis 和 StrongReject 等基准测试)中测试了这些新守卫,并发现了一些令人印象深刻的成果:

  • 速度:紧凑守卫是一个速度恶魔。在强大的计算机芯片(A100)上,其处理请求的速度比之前最佳的轻量级守卫快 1.6 倍,同时将“尾部延迟”(最慢请求所需的时间)控制在 1 秒以内。
  • 准确性:尽管它体积小巧,却出奇地强大。在安全测试中,“全能”版本的得分高于更大、更慢的模型。事实证明,你不需要一个拥有 200 亿参数的“巨人”来捕捉大多数不良行为者;一个拥有 2 亿参数的聪明“嗅探器”就足以胜任第一道防线的任务。
  • 隐私:它不仅阻止了不良词汇,还成功地在文本中找到了个人秘密(如姓名和地址),证明它可以取代独立的“隐私扫描器”。

策略:“分层”城市

该论文提出了一种运营这座城市的明智方法:将 GLiGuard 作为主大门

由于 GLiGuard 既快速又廉价,你可以将其置于所有人之前。它能瞬间捕捉明显的坏人并隐藏明显的秘密。

  • 如果 GLiGuard 对某个请求不确定(也许这是一条棘手、冗长或多语言的讯息),它可以将该特定请求传递给“慢巨人”(一个更大的 AI 模型)进行第二次、更深入的审查。
  • 通过这种方式,你只需为困难案例支付昂贵的费用,而快速、廉价的守卫则处理 99% 的流量。

新地图(PII-Bench)

为了证明其隐私保护能力,作者还创建了一张名为PII-Bench的新地图。这是一项专门设计的测试,用于评估守卫在俄语对话中发现个人秘密的能力。他们发现,他们的新守卫在这方面表现出色,尤其是当与简单的规则检查器(如针对电话号码的拼写检查器)结合使用时。

总结

简而言之,GLiNER Guard 是 AI 系统的一种实用、一体化的安全守卫。它通过提供一种速度快到足以处理数百万请求,同时又聪明到足以在一次扫视中捕捉安全违规和个人秘密的模型,解决了速度与安全性之间的旧有权衡。它使公司能够在不耗尽资金或拖慢用户速度的情况下,保持其 AI 系统的安全与隐私。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →