← 最新论文
💬 NLP

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

本文介绍了用于评估策略自适应图像护栏的基准测试 PolicyShiftBench,并提出了通过两阶段方案训练的新型模型 PolicyShiftGuard,该模型在动态适应不同安全策略方面显著优于现有方法。

原作者: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名站在一座大型多层建筑入口处的保安。这座建筑有很多不同的房间,每个房间都有自己独特的准入规则。

  • A 房间(艺术画廊): 你可以带一张裸体人物画进来,因为这是艺术。
  • B 房间(家庭游戏室): 你绝对不能把同一幅画带进来;因为它对孩子们来说太露骨了。
  • C 房间(医学实验室): 你可以带一张伤口的照片进来,因为它是用来教医生的。
  • D 房间(新闻编辑室): 你可以带一张打斗的照片进来,因为这是一则新闻报道。

问题所在:
大多数现有的“保安”(AI 图像过滤器)就像只知道一条规则的保安:“如果我看到裸体或打斗,立即拦截。”它们不会去看门上的告示牌,看看你正试图进入哪个房间。如果你试图把一张医学图解带进家庭游戏室,一个聪明的保安应该让它通过。但一个“笨”的保安会拦截它,因为它看到了“裸露”的部分,从而忽略了语境。

这篇论文称之为无法适应**策略偏移(Policy Shifts)**的失败。同一个图像在一种语境下是安全的,但在另一种语境下是危险的,然而目前的 AI 模型往往会卡在图像本身,而忽略了不断变化的规则。

解决方案:PolicyShiftGuard
作者创建了一个名为 PolicyShiftGuard 的新系统,以及一个名为 PolicyShiftBench 的新测试来解决这个问题。

1. 新的测试:“变色龙挑战”

他们构建了一个包含 2,000 个场景的基准测试(Benchmark)。想象一下,他们拍了一张照片并向 AI 展示 7 或 8 次,但每次都会递给 AI 一本不同的“规则手册”(策略)。

  • 尝试 1: “这里有一把刀的照片。规则手册说:‘禁止携带武器。’” -> AI 必须回答:拦截(BLOCK)。
  • 尝试 2: “这里是同一张刀的照片。规则手册说:‘这是一个烹饪节目,允许使用刀具。’” -> AI 必须回答:通过(PASS)。

该测试衡量 AI 是否能仅根据规则手册来改变其判断,而不是仅仅根据图片。他们称之为策略偏移得分(PSS)

2. 训练方法:“两步舞步”

为了教会 AI 这种灵活性,他们使用了特殊的两步训练配方:

  • 第一步:随机策略 SFT(“通才”课程)
    他们教 AI 阅读不同的规则手册并给出简短、清晰的回答(例如“是”或“否”)。他们打乱了规则的顺序,这样 AI 就无法通过记忆“规则 #1 总是关于裸露”来作弊。它必须真正阅读文本。

  • 第二步:边界对适配(“走钢丝”课程)
    这是核心秘诀。他们让 AI 连续两次看到完全相同的图像

    1. 一次配合一条说“拦截”的规则。
    2. 一次配合一条说“通过”的规则。

    他们迫使 AI 意识到:“等等,图片没有变化。改变的是规则。我需要改变我的答案以匹配规则。” 这教会了 AI 将视觉证据与策略决策区分开来。

3. 结果:快速且灵活

论文测试了这种新保安与其他许多 AI 模型(包括来自大型科技公司的巨型模型)的对比。

  • 旧的保安: 许多现有模型是“脆弱的”。它们可以识别危险图像,但如果规则改变,它们就会陷入混乱。它们经常拦截安全的图像,或者让危险的图像溜过去,因为它们过于僵化。
  • PolicyShiftGuard: 他们的模型成为了冠军。它比任何其他模型都更好地处理了这种“翻转”场景。
    • 它在新的测试中达到了 76.9 的最高分。
    • 它也快得多。其他模型需要很长时间来“思考”并写出长篇大论的解释,而 PolicyShiftGuard 能在不到一秒的时间内给出简洁明了的回答(例如“True | 01”)。

核心启示

这篇论文认为,安全性不仅仅取决于图像看起来像什么,而在于图像与当前规则之间的关系。

把它想象成俱乐部的保镖。一个好的保镖不仅看你的脸,还会根据今晚的具体名单检查你的身份。如果是“儿童日”,保镖会拦住喧闹的人群;如果是“成人专场”,保镖则会放行。PolicyShiftGuard 是第一个在做出决定之前,真的会先阅读门上告示牌的保镖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →