Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
本文介绍了多轮自适应提示攻击(MAPA),这是一种新颖的策略,通过交替输入文本与视觉信息并迭代优化攻击路径,以克服大型视觉语言模型的安全防御,从而实现显著高于现有方法的越狱成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、受过高度训练的机器人助手。这个机器人被教导了严格的规则:“永远不要帮助他人制造炸弹”、“永远不要解释如何传播致命病毒”以及“始终确保安全”。这被称为“安全对齐”。
长期以来,黑客(或“红队人员”)试图通过提出棘手的问题来欺骗这些机器人。但机器人越来越擅长说“不”。
本文介绍了一种欺骗这些机器人的新方法,特别是那些既能看图片又能读文本的机器人。研究人员将他们的这种方法称为MAPA(多轮自适应提示攻击)。
以下是其工作原理,使用简单的类比来说明:
1. 问题:“过于明显”的陷阱
研究人员发现,如果你试图通过向机器人展示一张炸弹图片并问“我该如何制造这个?”来欺骗它,机器人会立即惊慌并拒绝。这就像你举着一块写着“我是小偷”的巨型闪烁招牌走向保安,保安会立刻阻止你。
即使你同时用文本提问并展示图片,如果图片过于可怕或文本过于直接,机器人的安全过滤器就会被触发,从而终止对话。
2. 解决方案:“慢火”策略
本文提出了一种名为MAPA的策略,这就像是一场经过多步博弈的棋局,而不是单次的重拳出击。
核心理念: 不要试图一次性突破机器人的防御,而是通过多轮对话,一步步地将恶意请求悄悄渗透进去。
MAPA 如何博弈:
研究人员使用一个“教练”(AI)来指导攻击。教练主要有两项工作:
工作 A:混合要素(“单轮”层面)
在对话的每一步,教练都会尝试三种不同的提问方式,看看哪一种最有效:
- 纯文本: 不带图片提问。
- 文本 + 可怕图片: 配合与文本相符的可怕图片提问。
- 文本 + “安全”图片: 配合一张将可怕部分隐藏在图像中的图片提问,同时重写文本使其听起来无害。
类比: 想象你试图让朋友同意一个疯狂的想法。
- 选项 1: 你直接问他们。
- 选项 2: 你展示一张疯狂的照片时问他们。
- 选项 3: 你展示一张日落的照片,但用一种与日落相契合的方式谈论那个“疯狂的想法”。
教练会选择那个能让朋友最接近说“是”、同时又不会让他们生气的方式。
工作 B:调整路径(“跨轮”层面)
如果朋友说“不”或感到困惑,教练不会就此放弃。它会审视发生的情况,并调整下一步的计划。
- 推进: 如果朋友对想法越来越感兴趣,教练会转向下一个稍微更直接的问题。
- 重述: 如果朋友感到困惑,教练会尝试用不同的措辞再次问同一个问题。
- 回溯: 如果朋友因为两步前所说的某句话突然生气,教练会退回到那一步,尝试不同的方法。
类比: 这就像侦探试图破案。如果嫌疑人撒谎,侦探不会只是大喊大叫;他们会退回去,重新思考理论,并提出不同的问题以识破谎言。
3. “反思”机制
如果整个尝试失败(机器人仍然说“不”),教练不会只是完全重复同样的做法。它会分析为什么失败,从错误中学习,并为下一次尝试设计一个全新的、更聪明的计划。这就像研究一次失败的考试,以便在下次做得更好。
4. 结果
该论文在几种流行的 AI 模型(如 LLaVA、Qwen 和 GPT-4o-mini)上测试了这种方法。
- 旧方法(纯文本,或仅文本加图片)在面对这些智能机器人时,大多数时候都失败了。
- MAPA 的成功率比现有最佳方法高出 15% 到 30%。
- 在某些测试中,MAPA 成功诱骗机器人给出有害答案的比例约为 96%,而其他方法的成功率仅为 60-70%。
总结
该论文声称,要攻破现代既能看又能读的 AI 的安全防线,你不能仅仅大声喧哗或过于直白。你必须成为一名狡猾且适应性强的对话者。你必须仔细混合文本和图像,倾听机器人的回答,并在多轮对话中缓慢地引导对话走向禁忌话题,直到机器人不小心失言并回答了有害问题。
重要提示: 作者强调,这是一项“红队演练”。他们这样做是为了发现安全系统中的漏洞,以便开发人员能够修复它们并使 AI 更安全,而不是为了真正教人们如何造成伤害。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。