Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades
本文介绍了强制延迟攻击(Forced Deferral Attack, FDA),这是一种通过利用通用边界触发器降低弱模型的置信度,从而迫使计算昂贵的路由转向强模型,且不直接破坏答案正确性的多模态大语言模型级联对抗方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一家采用双层厨房系统的顶级餐厅。
设定:“快餐”与“主厨”
为了节省成本,餐厅使用了一种巧妙的系统。当顾客点餐时,一名初级厨师(弱模型)会首先尝试制作。
- 如果初级厨师有信心能完美制作,他们会立即上菜。这既便宜又快速。
- 如果初级厨师不确定或者认为订单太复杂,他们会将订单交给主厨(强模型)。主厨虽然昂贵且速度慢,但总能保证正确。
规则很简单:只有困难的订单才会交给主厨。 这保持了餐厅的高效运转。
漏洞:“信心破解”
研究人员发现了一种破坏这个系统的巧妙方法。他们意识到,整个过程都取决于初级厨师的信心。如果初级厨师心想:“我不确定这个,”订单就会转交给主厨。
研究人员发现,攻击者不需要欺骗主厨或弄坏食物。他们只需要诱导初级厨师感到不安全感。
攻击:“信心扁平化框架”
研究人员创建了一个特殊的、隐形的“框架”(边框),可以放置在客户提交的任何图片周围。
- 诡计: 当初级厨师看到带有这种特殊框架的图片时,他们的思维会变得混乱。即使图片非常清晰,他们也会开始感到不确定。
- 结果: 因为初级厨师突然感到“不确定”,系统会自动将订单转交给昂贵的主厨。
- 后果: 攻击者得到了来自主厨的高质量答案,但餐厅老板却不得不为每一份订单支付高昂的成本,甚至是那些简单的订单。
他们是如何做到的(“魔力框架”)
研究人员并没有在图片上涂鸦(这可能会毁掉主厨看到的图像),而是优化了一个通用的边界。
- 他们教计算机寻找一种特定的图像边缘模式,使初级厨师的大脑变得“扁平”且犹豫不决。
- 他们并不试图让初级厨师给出错误的答案;他们只是让初级厨师产生犹豫。
- 因为图片的中心部分保持原样,主厨仍然能看到清晰的图像并给出完美的答案。
为什么这很重要
这篇论文表明,这种“信心破解”在许多不同的 AI 模型和不同类型的提问中都有效。
- 它是通用的: 同一个边界几乎适用于任何图像。
- 它是隐形的: 图片对人类来说看起来依然正常。
- 它是昂贵的: 它迫使昂贵的 AI 去处理那些本该由廉价 AI 处理的工作,从而耗尽提供者的资源。
简而言之:
研究人员发现了一种在图像边缘贴上“削弱信心”贴纸的方法。这种贴纸不会改变图片,但会让廉价的 AI 对自己的工作感到紧张,从而被迫让昂贵的 AI 介入并免费工作。这是一种通过操控其“自我怀疑”来操纵系统预算的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。