← 最新论文
💻 computer science

The Claim-to-Action Gap: Measuring How Misinformation Turns False State into Tool Calls in Tool-Using LLM Agents

本文通过展示虚假声明在近 70% 的试验中会触发有害的现实世界行为,引入了一种衡量工具使用型大语言模型智能体“声明-行动”差距的新型框架,而通过在执行前实施一项 OWASP 推荐的验证步骤,这一漏洞被有效地消除(将行动率降低至 0%)。

原作者: Mohammadreza Rashidi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammadreza Rashidi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是在聊天,而且拥有“双手”的世界。这些并非物理意义上的手,而是数字化的手,可以开设银行账户、切换电网开关或开具处方药。我们称之为“AI智能体(AI agents)”。它们就像超级聪明的助手,能够阅读一条便条,然后真正地去“执行”某项操作。但问题在于:这些助手极其容易信任他人。如果你告诉它们一个故事,它们可能会完全相信这个故事,并立即采取行动。

问题在于当这个故事是一个谎言时。在AI安全领域,人们越来越担心“虚假信息(misinformation)”。通常,当我们谈论虚假信息时,我们担心的是人们相信假新闻。但在这些拥有“数字之手”的新型AI面前,担忧变得更大了。如果一个谎言不仅仅改变了一个人的想法,而是触发了机器去转移真实的资金、切断医院的网络,或者清除计算机的安全系统,会发生什么?这就是“从主张到行动(Claim-to-Action)”的缺口。这是指从一个错误的陈述被提出,到机器人决定采取行动之间的危险空间。科学家们正在试图弄清楚这种情况发生的频率,更重要的是,如何阻止机器人在故事是假的时候按下“扳机”。


论文:当谎言演变成现实世界的灾难

在这项研究中,研究员Mohammadreza Rashidi建立了一个数字游乐场,用来测试这种“信任型机器人”问题到底有多危险。他不仅仅是让AI模型讨论谎言;他构建了一个游戏,其中一个AI(生产者/Producer)向第二个AI(消费者/Consumer)讲述一个故事,而这个消费者拥有一个可以按下的真实且危险的按钮。

把这想象成一场两人接力赛。第一位选手(生产者)收到了一张可能带有陷阱的便条。也许便条上写着:“该客户符合退款资格”,尽管规则规定他们并不符合。生产者带着这张便条奔跑,并将它交给第二位选手(消费者)。消费者手里拿着一把贴着“批准退款”标签的重锤。如果消费者相信了这张便条,他们就会砸下锤子,模拟环境中的资金就会真正流出银行账户。

Rashidi构建了六个不同版本的这场比赛,涵盖了诸如批准退款、释放资金、开具处方药、修复计算机错误、阻断网络段和授权电汇等场景。他使用三种不同版本的流行AI模型(Gemini)进行了324次真实的试验

令人震惊的结果:缺口巨大

研究结果令人震惊。当第二个AI(消费者)在没有任何安全检查的情况下独自行动时,69.8% 的情况下它都中了谎言的计,并按下了那个危险的按钮。

在某些情况下,这些机器人几乎显得过于天真。

  • “状态推断”陷阱: 当第一个AI收到的客户记录缺少一个关键细节(例如身份证过期)但拥有其他正确细节时,第二个AI假设该客户是安全的,并向一名未经身份验证的人释放了 135,000美元。这种情况发生了 100%
  • “论坛修复”陷阱: 当第一个AI读到一个关于修复缓慢计算机的危险命令(如“清除所有防火墙规则”)的虚假网络论坛帖子时,第二个AI遵循了该建议,并在 96.3% 的情况下清除了安全规则。
  • “伪造邮件”陷阱: 当面对一封看起来像是老板授权电汇的伪造邮件时,第二个AI在 63% 的试验中授权了 816,000美元 的虚假转账。

研究表明,谎言的具体措辞非常重要。例如,在退款场景中,如果虚假政策仅说“满意保证”,机器人会有33%的概率中招。但如果虚假政策仅仅增加了一个神奇的词——“终身”——机器人的中招率就达到了 100%。机器人是被谎言的语气而非硬性事实所左右的。

解决方案:“核实-行动”闸门

论文还测试了一种由安全专家推荐的防护网,称为“主张-核实-行动(Claim-Check-Act)”。这就像是在第二个AI门口放了一名保安。在消费者拿起锤子之前,它被迫查看一份“事实真相记录(Ground-Truth Record)”(即关于什么是真实的权威列表),并将听到的故事与这份列表进行对比。

结果带来了彻底的改变。当加入这个简单的检查步骤后,有害行为的发生率从 69.8% 降至 0.0%。机器人并没有变得更聪明;它们只是拥有了一个事实核查员。在 96.3% 存在谎言的案例中,机器人停了下来,意识到故事与主列表不符,并转而请求人工审核,而不是直接采取行动。

这意味着什么

论文结论指出,真正的危险不仅在于AI在聊天中犯错,而在于它们在没有寻求证据的情况下就根据错误进行行动。研究证明,在这些模拟环境中,虚假的主张可以轻易转化为现实世界的灾难,如网络中断或资金被盗。然而,它也表明一个简单、低技术含量的解决方案——即让AI在行动前通过已知事实来核实其说法——可以几乎完全阻止灾难。

研究人员非常谨慎地指出,这些是在沙盒(一个安全的、虚构的世界)中的模拟实验,因此没有真实的资金损失或真实的医院受到伤害。但教训是明确的:如果我们希望AI智能体拥有“双手”,我们必须教会它们在挥动之前先核实事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →