← 最新论文
💬 NLP

Shieldstral

Shieldstral 是一个紧凑的 3B 参数策略自适应多模态安全分类器,它将多样化的内容审核任务统一到二元问答框架中,通过一个包含 5410 万个样本的海量精选数据集,使其能够达到或超越规模显著更大的模型。

原作者: Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下互联网是一个巨大且繁忙的数字城市。在这个城市里,有数百万人正在聊天、分享照片和提问。但就像任何真实的城市一样,它也需要规则来保持安全。有时,人们会说些难听的话,分享危险的秘密,或者发布不该出现的图片。为了阻止这些行为,我们使用了“护栏”——特殊的计算机程序,它们充当保镖的角色,在信息到达公众面前之前检查每一条消息和图像。

长期以来,这些保镖一直有些死板。它们就像是拿着一本单一且不可更改的规则手册的保安:“如果你看到刀,就停止。如果你看到脏话,就停止。”但现实世界是复杂的。一张关于刀的图片在心理健康聊天室里可能令人恐惧,但在视频游戏教程或关于剑的历史课中却是完全没问题的。旧的守卫无法理解背后的“语境”或“原因”,它们只是看到了物体就陷入了恐慌。科学家们一直试图构建更聪明的守卫,让它们能够理解自己所处房间的具体规则,而不是仅仅对着一切大喊“停止!”这就是“策略自适应(policy-adaptive)”安全的挑战:教导人工智能理解在一种情况下安全的东西在另一种情况下可能并不安全。

现在,出现了一个名为 Shieldstral 的新型数字保镖,它正试图改变游戏规则。Shieldstral 并不是一个庞大、缓慢且昂贵的机器人,它是一个极其灵巧的 30 亿参数模型(可以把它想象成一个非常聪明且紧凑的大脑)。其背后的研究人员发现,如果你教它正确思考的方式,你并不需要一个巨大的大脑也能成为一名优秀的守卫。

这里有一个神奇的诀窍:研究团队并没有训练这个 AI 去死记硬背一份冗长的“坏事清单”(就像学生背诵一本禁词字典),而是教会了 Shieldstral 玩一个简单的 “是/否”游戏。他们给 AI 一个具体的问题,比如“这张图片是否显示有人在遭受霸凌?”或者“这段文本是否在试图欺骗计算机?”,并要求它用简单的“是”或“否”来回答。

这听起来可能过于简单,但它非常精妙。因为 AI 不是在死记硬背一份固定的清单,所以它可以处理你抛给它的任何问题。如果你正在运行一个网络安全工具,你可以问:“这段代码是否在尝试黑入银行?”如果你正在运行一个学校论坛,你可以问:“这段文字是否在霸凌学生?”Shieldstral 会倾听你的具体问题,并根据该问题给出评分。这就像拥有一个不仅看你的脸,还会先听你为什么来这里,然后再决定是否让你进入的守卫。

为了教这个小模型变得如此聪明,研究人员必须喂给它大量的“食物”——大约 5410 万个示例!他们并没有把随机的互联网帖子直接丢给它。他们是非常细心的厨师。他们从各处收集杂乱的数据(有些规则严格,有些规则宽松),并将它们全部转化为统一的“问题 + 答案”格式。他们甚至创建了一种特殊的训练方法,称为“对比学习(contrastive learning)”。想象一下向 AI 展示两个几乎完全相同的场景:一个场景中角色表现得很刻薄,而另一个场景中他们只是在开玩笑。AI 必须根据提出的具体问题,学会分辨这两者之间的细微差别。这有助于它理解“细微差别(nuance)”,而不仅仅是表面层次。

结果非常惊人。尽管 Shieldstral 很小(只有 30 亿参数),但它的表现竟然能与一些规模大得多的安全模型(约 200 亿参数,即其体积的 7 倍)持平,甚至更好。在测试 AI 是否能适应从未见过的特定新规则时,Shieldstral 取得了令人印象深刻的 91.3% 的得分。在多模态任务(同时检查文本和图像)中,它也击败了竞争对手,达到了 83.8% 的平均分。

论文指出,这种方法——将安全转化为灵活的问答游戏,并在大量精心策划的数据上进行训练——可以让小型模型发挥出远超其规模的实力。它证明了你不需要一个巨大且昂贵的大脑也能成为一名好守卫;你只需要教会它如何倾听房间里的规则。Shieldstral 表明,一个小型且具有适应性的模型可以匹配甚至超越那些庞大且僵化的模型,这使得在任何地方实现更安全、更智能、更高效的人工智能成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →