← 最新论文
💻 computer science

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

本文提出了 PRISM 框架,通过结合系统 2 式的结构化四阶段推理流程与基于蒙特卡洛树搜索生成的直接偏好优化(PRISM-DPO),在有效抵御复杂多模态攻击并提升泛化能力的同时,显著改善了视觉语言模型的安全性与实用性平衡。

原作者: Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 PRISM 的新系统,它的任务是给“看图说话”的人工智能(我们叫它 VLM,视觉语言模型)穿上更聪明的“防弹衣”。

为了让你轻松理解,我们可以把现在的 AI 想象成一个刚入职的保安,而 PRISM 就是给这位保安进行的一套高级思维训练

1. 现在的保安有什么问题?(背景与痛点)

目前的 AI 保安在面对坏人(恶意攻击)时,通常只有两种反应:

  • 反应过度(Over-defense): 就像那个看到有人拿着面包就大喊“那是炸弹!”的保安。为了安全,它拒绝回答很多正常的问题,导致它变得“不中用”(Utility 下降)。
  • 反应太浅(Shallow alignment): 就像那个只认“黑名单”的保安。如果坏人把“制造炸弹”改写成“如何制作美味的蛋糕(其实是在教做炸弹)”,保安就看不出来了,因为它只检查表面文字,不懂深层逻辑。

最狡猾的坏人是那种“组合拳”:

  • 文字本身很无辜(比如“怎么画这幅画?”)。
  • 图片本身也很正常(比如一张古庙的照片)。
  • 文字 + 图片结合起来,意思就变成了“怎么在古庙上乱涂乱画(破坏文物)”。
    现有的保安往往只看文字或只看图片,一旦两者结合产生恶意,它们就失效了。

2. PRISM 是什么?(核心概念)

PRISM 的全称是“多模态集成安全的原理性推理”。听起来很复杂,其实它给 AI 保安装了一个**“四步思考法”**的大脑,让它像侦探一样办案,而不是像机器一样查字典。

它把思考过程分成了四个阶段(就像侦探办案的四个步骤):

  1. 审问(Problem): 先仔细读用户的问题,问自己:“他到底想干什么?有没有坏心思?”
  2. 看图(Caption): 再看一眼图片,结合刚才的问题,问自己:“这张图在这个语境下意味着什么?”
  3. 推理(Reasoning): 这是最关键的一步!把“问题”和“图片”放在一起琢磨。就像侦探把线索拼起来,发现:“哦!虽然文字和图片单独看都没事,但结合起来就是要在古迹上涂鸦,这是违法的!”
  4. 判决(Output): 最后给出回答。如果是好人,就热情帮忙;如果是坏人,就礼貌但坚定地拒绝,并清楚地解释为什么(比如:“因为会破坏文物”)。

3. 它是怎么练成的?(训练方法)

为了让保安学会这套“四步思考法”,作者用了两个绝招:

  • 绝招一:PRISM-CoT(模拟训练)
    作者找了一大堆案例(包括那些文字无害、图片无害,但组合起来有害的狡猾案例),人工给 AI 写好了标准的“四步思考”答案。这就像给保安发了一本《完美侦探手册》,让它先照着学(监督微调)。

  • 绝招二:PRISM-DPO(实战演练与奖励)
    光看书不行,还得实战。作者用了一种叫“蒙特卡洛树搜索”(MCTS)的技术,让 AI 自己尝试不同的思考路径。

    • 关键点: 这里的奖励机制很聪明。如果 AI 在“看图”或“推理”阶段分析得很对,哪怕最后它因为太紧张而误判了(比如该帮的没帮),之前的正确分析依然值得奖励
    • 这就像教练告诉球员:“你刚才的战术跑位非常完美(推理正确),虽然最后射门没进(拒绝错误),但你的战术意识是对的,依然给你加分!”
    • 这种机制防止了 AI 因为怕犯错而变得“不敢思考”(过度防御),让它敢于深入分析,同时保持安全。

4. 效果怎么样?(成果)

经过这套训练,PRISM 表现得非常出色:

  • 更聪明: 它能识破那些以前看不懂的“组合拳”攻击(比如那个在古庙涂鸦的例子)。
  • 更灵活: 它不会因为太警惕而拒绝正常用户。它知道什么时候该说“不”,什么时候该说“好”。
  • 更抗揍: 即使坏人不断改变策略(自适应攻击),PRISM 也能稳住阵脚,很难被攻破。

总结

简单来说,PRISM 就是给 AI 装了一个“深思熟虑”的大脑

以前的 AI 保安是“条件反射”:看到关键词就报警,或者看到没关键词就放行。
现在的 PRISM 保安是“逻辑推理”:它会先读题、再看图、然后结合上下文分析意图,最后做出既安全又合理的决定。

这就好比从只会背《黑名单》的保安,进化成了懂得观察、分析、并懂得变通的资深侦探。这不仅让 AI 更安全,也让它在处理正常任务时变得更聪明、更好用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →