When AI Persuades: Adversarial Explanation Attacks on Human Trust in AI-Assisted Decision Making
本文介绍了对抗性解释攻击(AEAs),即通过操纵大语言模型生成的解释来维持人类对错误 AI 预测的信任,并通过一项涉及 200 多名参与者的研究揭示,用户极易受到此类认知操纵的影响,尤其是当解释模仿专家沟通方式或针对受教育程度较低且更富信任感的个体时。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一个非常聪明、言辞得体的机器人咨询一个棘手的问题,比如选择医疗方案或进行投资。你信任这个机器人,因为它清晰地解释了其推理过程。
这篇论文揭示了一个令人恐惧的新伎俩:作恶者无需破坏机器人的“大脑”来欺骗你;他们只需改变机器人的说话方式即可。
以下是这项研究的分解说明,使用了简单的类比:
1. 新的“黑客”手段
通常,当我们想到黑客攻击人工智能时,会想象有人潜入计算机代码,迫使机器人给出错误答案。
- 旧方式:撬开前门的锁。
- 新方式(对抗性解释攻击):机器人仍然给出错误的答案,但黑客改变了机器人阅读的脚本。机器人现在听起来像是一位冷静、自信且受过高等教育的专家。它使用华丽的辞藻,引用虚假的统计数据,并以中立、专业的语气发言。
论文将这种攻击称为对抗性解释攻击(Adversarial Explanation Attack, AEA)。攻击者并没有改变数学逻辑;他们只是给错误的答案穿上了一件燕尾服,使其看起来值得信赖。
2. “信任校准失误”陷阱
研究人员想要验证这种“华丽西装”是否真的对人类有效。他们设计了一个涉及 200 多人的游戏。
- 设置:人们被要求借助人工智能解决问题。有时人工智能是正确的,并给出了简单的解释;有时人工智能是错误的,但其解释经过精心雕琢,听起来像顶级专家(使用引用、中立语气和逻辑步骤)。
- 结果:人们无法分辨差异。他们信任“错误但华丽”的答案的程度,几乎与信任“正确且简单”的答案一样。
- 比喻:这就像魔术师。如果魔术师给了你一张错误的牌,但他用如此流畅的自信和科学术语来解释这个戏法,让你因怀疑他而感到愚蠢,你仍然会相信他。研究发现,对于许多用户而言,说服力比真相更强大。
3. 谁最容易受骗?
研究发现,并非所有人都会同等程度地落入这个圈套。这就像一把锁,对某些钥匙来说更容易被撬开。
- “困难”任务:当问题非常难(如高等物理或复杂的商业战略)时,人们更倾向于信任这种“专家”声音,因为他们觉得自己没有足够的信心去自行核查。
- 事实密集型领域:在医学或商业等事实和数字似乎占据主导地位的领域,这种虚假的“专家”声音效果最好。人们会想:“如果听起来像医生或银行家,那一定是真的。”
- 易感群体:
- 年轻人比老年人更容易被左右。
- 受教育程度较低的人比拥有高等学位的人更信任华丽的解释(后者倾向于双重检查逻辑)。
- 已经喜爱人工智能的人最容易受骗。如果你已经信任机器人,你就更不太可能质疑其华丽的言辞。
4. “专家”伪装
是什么让最棘手的解释奏效了?它们听起来不像试图炒作产品的推销员,而像一位枯燥、中立的教授。
- 制胜公式:冷静的语气 + 听起来真实的引用(虚构或真实)+ 逐步的逻辑。
- 失败者:过于情绪化、过于顺从(“你完全正确!”)或过于花哨的解释,实际上让人们更不信任人工智能。
5. 效果会消退吗?
研究人员观察了随时间推移发生的情况。
- 短期:如果你看到一条虚假的解释,你可能仍然会信任它。
- 长期:如果你连续看到大量虚假解释,你的信任开始崩塌。这就像“狼来了”的故事。最终,人们开始意识到:“等等,这个机器人即使听起来很聪明,也一直在犯错。”
- 然而,如果机器人开始再次给出正确的答案,信任会迅速恢复。
核心结论
这篇论文认为,安全不仅仅是保护代码;更是保护对话。
如果攻击者能够控制人工智能如何解释其答案,他们就能让你信任一个错误的决定,而无需触碰人工智能的实际“大脑”。研究结论是,我们需要小心,不要因流利、自信的声音而被愚弄,当 underlying 事实站不住脚时。我们需要关注内容,而不仅仅是风格。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。