ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models
ReFrame 是一个无需训练、基于证据的测试时框架,它通过利用两个轻量级智能体生成风险/效用证据并将输入重构为安全代理,从而在不修改目标模型的情况下,有效克服效用主导和推理惯性,增强多模态大语言模型的安全性对齐。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,新一代模型已经出现,它们能够同时进行视觉观察和语言表达。这些被称为多模态大语言模型的系统不仅能处理文本,还能理解图像,将视觉细节与书面文字联系起来,从而回答问题、解决问题并生成创意内容。然而,这种扩展的视觉与推理能力也带来了一个复杂的全新挑战:安全性。虽然这些模型旨在提供帮助,但有时会被诱骗而忽略其安全规则。攻击者可能会将有害请求隐藏在一张图片中,或者将一条危险指令拆分在图像和句子之间,从而迷惑模型,使其认为该请求是无害的。这给开发者带来了困难的局面。许多最强大的模型都是“黑盒”,这意味着它们的内部运作机制是隐藏的,外部用户无法对其进行更改或重新训练。当一个模型已经部署且无法修改时,如何在不破坏其可用性的前提下保持其安全,就成了一个关键的难题。
研究人员一直在探索解决这一问题的方法,但许多现有的解决方案需要访问模型的内部代码,或者涉及昂贵的重新训练,而这对于封闭系统来说是不可能的。一组科学家现在提出了一种不同的方法,称为 ReFrame,这种方法在用户请求到达模型之前充当一个智能过滤器。ReFrame 不尝试改变模型本身,而是拦截传入的图像和文本,对它们进行分析,并将请求重写为更安全的版本。这个过程完全在使用的瞬间发生,无需触碰模型的内部设置,也不需要利用新数据对其进行重新训练。该系统旨在捕捉那些可能穿透标准防御措施的隐藏危险,同时确保模型仍能有效地回答合法的提问。
研究人员发现的核心问题在于,这些模型往往优先考虑“有用性”而非“安全性”。当用户提问时,模型的主要驱动力是完成任务,这有时会导致它忽视隐藏在图像或复杂句子结构中的微妙风险。此外,一旦模型开始遵循某条推理路径,它可能会陷入有害的路径中,即使它稍后意识到危险,也会继续生成不安全的内容。为了解决这个问题,研究人员构建了一个两步走的系统,使用一个较小的本地 AI 模型来充当守门员。这个守门员并不直接回答用户的提问,而是检查请求并创建两个特定的摘要,即“卡片”,来描述当前的情况。
第一张卡片是“风险卡”,用于寻找任何隐藏的危险。它会询问:图像或文本中是否隐藏了有害意图?如果答案为“是”,它会识别出危险的具体内容,并计划如何重写请求以消除威胁。第二张卡片是“效用卡”,侧重于哪些部分应该被保留。它会询问:请求中有哪些部分是无害且有用的?这确保了在移除危险部分时,系统不会丢弃整个问题,也不会拒绝回答一个实际上是安全的课题。通过将风险与效用分离,系统可以做出精确的决策。
一旦创建了这两张卡片,第二步就会接管。这部分系统结合来自两张卡片的信息来重写原始请求。如果请求最初是安全的,系统会仅进行微调后将其通过。如果请求包含陷阱,系统会重写提示词,引导模型走向安全且有益的回答。例如,如果用户以游戏场景为框架请求犯罪指令,系统会识别出该游戏包装是一种伪装。它会剥离游戏指令,并将提示词重写为询问安全或法律替代方案。至关重要的是,系统还会决定是否随重写后的文本一起发送原始图像。有时图像本身包含了危险线索,因此系统会拦截它;而其他时候,图像是无害且对回答问题必要的,因此会被允许通过。
研究人员在几种不同的模型上测试了这种方法,其中包括目前最先进的一些商业系统。他们使用了多种旨在诱骗模型违反安全规则的测试,同时也使用了测试模型是否仍能回答关于数学、科学和日常物品的正常问题的测试。结果显示,这种新方法在阻止其他防御手段漏掉的有害请求方面非常有效。它成功拦截了那些危险隐藏在镜像图像中或通过篡改文本来隐藏恶意意图的攻击。同时,它并没有让模型变得过度谨慎。在用户询问有关医学或化学等敏感话题的安全问题时,系统允许模型提供有益的回答,而不是拒绝交流。
研究还观察了这一过程增加了多少额外时间。由于系统使用一个较小的本地模型在主模型回答之前进行重写,因此会增加一小段延迟,但研究人员发现这种成本是在可控范围内的。该方法证明了其灵活性,能够很好地适配不同类型的模型和不同规模的本地守门员。这表明该方法并不局限于某种特定技术,而是可以广泛应用。研究结果表明,通过仔细分析图像-文本对背后的意图,并在请求到达主模型之前对其进行重写,可以在不牺牲模型有用性的前提下,显著提高安全性。这为在无法改变内部运作机制的情况下,保持强大 AI 系统安全提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。