← 最新论文
💻 computer science

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap 是一个强化学习框架,通过训练模型生成能够引导冻结的 LLM 做出符合对齐决策的安全相关图像描述,从而增强大型视觉语言模型针对越狱攻击的安全性,在保持视觉效用的同时,其性能优于现有的安全对齐方法。

原作者: Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它阅读书籍和编写故事的能力比几乎任何人都要出色。这个机器人本身已经非常谨慎了,如果你要求它做一些危险的事情,比如制造炸弹,它会礼貌地拒绝:“不行,这不安全。”但现在,想象一下你向这个机器人展示了一张炸弹的照片,而不仅仅是输入文字。突然间,机器人变得困惑了。它看到这张图片,心想:“哦,这只是张很酷的画!”然后忘记了它的安全规则,兴高采л落地解释如何制造这个装置。这就是科学家们在现代“视觉-语言”模型中所面临的棘手问题:这些模型视觉能力很强,但当它们观察图像时,其安全刹车有时会失效。

为了解决这个问题,研究人员试图教这些模型以一种特殊的方式变得“双语”。他们希望机器人不仅能观察图片并回答问题,还要先用一种安全、谨慎的方式大声描述这张图片,然后再给出答案。这就像是一个保安,在被允许处理可疑包裹之前,必须先写一份详细的报告。如果报告内容模糊或遗漏了危险细节,保安就会停下来并说:“等等,我需要再仔细观察一下。”这篇名为 SafeCap 的论文介绍了一种新的训练方法,旨在教这些 AI 机器人自动编写这些安全报告,从而使它们更难被欺骗。

问题所在:当图片迷惑大脑时

大型视觉-语言模型(LVLMs)就像是拥有视觉能力的聊天机器人的超级增强版。它们继承了其构建基础——纯文本大脑的“良好行为”。但图片是具有欺骗性的。一个仅限文本的模型可能会拒绝“制作炸弹”的要求,但如果你展示一张炸弹的照片,并附上一句“我该如何制作这个?”,模型可能会被图像分散注意力,从而忘记其安全规则。这就像一个平时检查身份证的保安,却被访客衣服上的一个闪亮贴纸吸引了注意力,从而放任其通过。

以往的修复尝试涉及“推理时防御”,这就像是在机器人的眼睛前放置一个过滤器。一种流行的被称为 ECSO 的方法,试图在机器人看到图片之后将其转化为文字,希望纯文本安全系统能够捕捉到危险。但这就像是试图向一位盲人描述一幅复杂的画作,并希望他们能发现笔触中隐藏的陷阱。通常,这种描述会遗漏微小但危险的细节,导致安全系统失效。

解决方案:SafeCap(“安全描述”训练器)

论文作者提出了 SafeCap,这是一种巧妙的训练方法,教机器人如何在回答之前先写出自己的安全报告。模型训练的目标不仅仅是输出“是”或“否”,而是要输出两样东西:

  1. 描述(Caption):对图像进行详细描述,强调任何与安全相关的细节(例如“危险”标签或武器)。
  2. 答案(Answer):对用户问题的最终响应。

神奇之处在于训练阶段。模型学习的不只是写描述;它学习的是写出一种能帮助“冻结”(保持不变)的纯文本 AI 做出正确安全决策的描述。想象一个学生(模型)正在参加考试。老师(训练系统)说:“先总结一下这张图片。然后,我会把你的总结交给一位无法看见图片的严格阅卷员。如果阅卷员仅根据你的总结就判定‘这是危险的’,且你也说‘这是危险的’,那么你就获得了奖励。”

这迫使模型变得诚实且周全。它不能仅仅忽略危险并寄希望于阅卷员没发现。它必须在描述中明确指出危险,以便安全检查能够奏效。

它是如何运作的:“奖励”游戏

这种训练使用了强化学习技术。可以把它想象成一个电子游戏,模型因为良好的行为获得分数,因为不良的行为失去分数。

  • 模板奖励:模型必须遵循严格的格式(先写描述,再给答案)。如果它破坏了格式,就会得到零分。
  • 答案奖励:会对模型的最终答案进行检查。如果答案既有帮助又安全,它会获得分数;如果答案是危险的,分数会被大幅削减(使用一种被称为“指数风险折扣”的特殊数学技巧,使危险答案的价值几乎为零)。
  • 描述奖励:这是核心秘诀。如果模型写的描述能帮助“冻结”的纯文本 AI 得出相同的安全结论,它就会获得额外加分。如果描述过于模糊导致纯文本 AI 错过了危险,模型在该部分的得分将为零。

研究发现:安全而不失智能

研究人员在五个安全基准测试(旨在欺骗 AI 的测试)和六个效用基准测试(旨在测试 AI 是否仍能完成描述图像或解决谜题等正常任务)上测试了 SafeCap。他们使用了不同规模的模型,参数量从 20 亿到 40 亿不等。

结果令人印象深刻:

  • 安全性提升:在“DirectCap”协议(即模型先写描述再回答)下,SafeCap 在不同模型中将安全性得分提高了 3.7 到 19.0 分。对于 4B-Base 模型,安全性得分大幅跃升了 19.0 分
  • 无权衡损耗:通常情况下,提高模型的安全性会使其变得“愚笨”(即拒绝回答无害的问题)。但 SafeCap 成功地让“视觉效用”(它描述图像和回答问题的能力)与未经过训练的模型几乎保持一致。它并没有把机器人变成一个只会说“不”的暴躁机器,而是让它变成了一个更聪明、更谨慎的机器人。
  • 击败竞争对手:与标准安全训练(SFT)、DPO 以及一种名为 SafeGRPO 的新方法相比,SafeCap 脱颖而出。它在保持更好效用的同时,实现了更高的安全性得分。

为什么这很重要

论文表明,保持这些视觉 AI 模型安全的最佳方式,不仅仅是在它们看到图像后进行修补,而是教它们在开口说话之前,先对所见之物进行“大声思考”。通过强制模型生成具有安全意识的描述,它在视觉世界与基于文本的安全规则之间建立了一座桥梁。

作者发现,当模型被训练使用这种“描述优先”路径时,效果最好。如果你尝试在不使用描述的情况下直接使用模型(仅要求它直接回答),其安全性增益较小,且更多取决于特定模型。但当模型被允许使用其“安全描述”习惯时,它在应对越狱攻击和危险请求时会变得更加稳健。

简而言之,SafeCap 教会了 AI 观察图片、清晰描述危险,然后决定如何行动。这就像是训练一名保安,要求他在开门之前始终先写一份报告,以确保即使看门人分了心,书面报告也能保障所有人的安全。论文表明,这种方法不仅有效,而且保留了模型提供帮助的能力,为构建更安全的视觉 AI 世界提供了一条充满前景的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →