Hallucination as Exploit: Evidence-Carrying Multimodal Agents
本文介绍了携带证据的多模态代理(ECA),这是一种安全架构,它要求工具调用必须经过与类型化的外部证据证书进行验证,而非依赖模型未经证实的感知主张,从而防止由幻觉引发的授权失败。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明但略显轻信的个人助理。这位助理可以查看截图、阅读邮件并浏览网页,以帮助你完成诸如转账、点击按钮或提取数据等任务。
问题在于,这位助理有时会产生幻觉。它可能会自信地告诉你:“我看到一个写着‘向我的朋友转账 500 美元’的按钮”,而实际上该按钮并不存在,或者它其实是黑客设下的陷阱。
在过去,如果助理犯了错,那仅仅是一个“糟糕的回答”。但当这位助理连接到真实工具(如银行转账或电子邮件客户端)时,幻觉就不再仅仅是错误——它变成了安全漏洞。助理相信了一个虚假事实,并因其相信而执行了危险操作。
本文介绍了一种名为**ECA(携带证据的多模态代理)**的新系统来解决这一问题。以下是其工作原理,使用简单的类比说明:
1. 问题所在:“轻信的经理”
将标准 AI 代理想象成一位坐在房间里的经理。
- 经理查看一份文件(即屏幕),说道:“我在这里看到一个‘支付’按钮。我将点击它。”
- 如果这份文件是黑客伪造的图像,经理仍然会看到“支付”按钮,因为 AI 想象它存在。
- 随后经理点击了按钮,导致资金被盗。经理并非执行了恶意命令;他们只是幻觉出了行动的许可。
2. 解决方案:“携带证据的代理”
作者提出了一种新架构,其中经理不再是唯一负责人。他们增加了一位保安和一位公证人。
- 经理(AI):仍然负责思考。他们查看屏幕并说:“我认为我们应该点击那个按钮。”
- 公证人(验证器):在经理实际点击按钮之前,一个独立的严格系统(公证人)会使用不同工具(如用于文本的放大镜、用于代码的扫描仪、用于布局的地图)检查屏幕。
- 证书:公证人不会只说“好的”。它会颁发一份数字证书。这份证书是一份打字生成、不可更改的收据,上面写着:“我,公证人,确认标有‘支付’的按钮确实存在于这些精确坐标处。”
3. “大门”(守门人)
在经理与行动之间有一道大门。
- 经理不能仅凭说“我相信按钮在那里”就打开大门。
- 只有当经理出示来自公证人的证书时,大门才会打开。
- 如果经理试图说“我看到了一个按钮”,但公证人未为此颁发证书,大门将保持锁定。该行动将被阻止。
4. 为何此法不同
- 旧方式:AI 的言论即为法律。如果 AI 说“我看到一笔银行转账”,系统就会执行。
- 新方式(ECA):AI 的言论只是一个建议。只有当独立证据(例如对实际网页代码的扫描)证明该建议为真时,系统才会采取行动。
结果:效果如何?
研究人员用该系统对抗了数千次攻击,包括黑客试图利用伪造图像、隐藏文本和混淆符号来欺骗 AI。
- “轻信的经理”(旧 AI):几乎 100% 失败。如果 AI 幻觉出危险行动,它就会执行。
- “仅提示”防御(仅告诉 AI 要小心):约 50% 失败。AI 仍会被自身的幻觉所欺骗。
- 新系统(ECA):
- 在其端到端测试中,它阻止了**100%**的不安全操作。
- 即使黑客试图直接欺骗“公证人”(验证器),该系统也具备“强化”流程,将失败率降低至接近零(初始测试中降至 1.3%,最终测试中降至 0%)。
- 它并未阻止 AI 执行有益任务;它仍允许 100% 的安全、常规任务正常进行。
核心结论
本文认为,我们不能依赖 AI 的“大脑”来判断行动是否安全。AI 过于容易编造事实。相反,我们需要一种结构性检查:一个独立的系统,在行动发生前对事实进行物理验证。
这就像说:“你不能仅凭声称自己有票就登机。你必须出示由机场系统打印的实体票。”如果你没有实体票,无论多么自信地声称自己有票,大门都不会打开。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。