How do Humans Process AI-generated Hallucination Contents: a Neuroimaging Study
这项神经影像学研究利用脑电图(EEG)证明,人类大脑在处理人工智能生成的幻觉时表现出独特的神经动力学特征,揭示出被误判的幻觉未能激活标准的神经认知事实核查通路。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的大脑就像一位在博物馆里工作的高度精密的安保人员。它的工作是检查每一件艺术品(在本案中,即每一个句子),以确保其与它本应代表的现实相符。
这篇论文就像是一部关于这位安保人员大脑的“幕后”纪录片,使用了一顶特殊的头盔(脑电图,EEG)来记录电信号。研究人员想要观察,当安保人员看到一张猫的照片,但人工智能将其描述为“戴帽子的狗”时,其大脑内部会发生什么。
以下是他们发现的故事,分解为简单的步骤:
1. 设置:“找出谎言”游戏
研究人员将 27 人安置在一个房间里。他们向这些人展示一张图片,随后展示一句描述该图片的句子。有时句子是正确的。有时,人工智能会编造一个“幻觉”(一个听起来非常可信的谎言)。
参与者必须按下按钮来回答:“这句话是否与图片相符?”
- 真实匹配:句子是正确的。
- 识破谎言:句子是错误的,且参与者表示:“不,那是错的。”
- 漏掉谎言:句子是错误的,但参与者认为:“是的,这看起来是对的。”
2. 大脑的“警报系统”(当你识破谎言时会发生什么)
当参与者成功识破人工智能的谎言时,他们的大脑会经历一套非常具体、快节奏的流程,就像安保系统正在执行检查清单:
- 初始闪光(100 毫秒):大脑的“传感器”立即亮起。这就像安保人员立刻察觉到某处有点“不对劲”。这需要额外的注意力和脑力。
- “等一下”时刻(200 毫秒):大脑将该词标记为可疑。这就像安保人员心想:“这与场景不符。”
- 含义检查(400 毫秒):大脑试图将该词融入故事中。由于该词与图片无法对应,大脑必须更努力地处理这种冲突。这就像试图强行将方形的钉子塞进圆形的孔里;你的大脑会感受到摩擦。
- 最终复核(600 毫秒以上):大脑进行最后的复查。它调取记忆和逻辑来确认:“是的,这绝对是个谎言。”
关键发现:当人们识破谎言时,他们的大脑会显示出所有这些独特且强烈的信号。这是一场全面的安保警报。
3. “静默的失败”(当你漏掉谎言时会发生什么)
这里是令人恐惧的部分。当人工智能的谎言过于流畅和可信,以至于参与者没有识破它时,大脑的安保系统并没有触发警报。
- 大脑没有显示出“等一下”的信号。
- 它没有显示出“含义检查”的挣扎。
- 它没有显示出“最终复核”。
对大脑而言,这个谎言看起来与真相完全一样。研究人员发现,如果一个人未能发现幻觉,其大脑活动看起来几乎与他们看到真实句子时完全相同。具有欺骗性的 AI 成功诱骗了大脑的内部警报系统保持静默。
4. 我们能通过读心来识破谎言吗?
研究人员试图构建一个计算机程序,通过观察大脑信号来猜测:“这句话是谎言吗?”
- 当参与者识破谎言时:计算机非常擅长此道(准确率超过 90%)。大脑信号响亮且清晰。
- 当参与者漏掉谎言时:计算机完全失败。它无法区分谎言和真相,因为大脑并没有发出任何出错的信号。
核心要点
将人工智能的幻觉想象成一位技艺高超的魔术师。
- 如果魔术师犯了一个你能看见的错误,你的大脑会尖叫:“嘿,那是个戏法!”
- 但如果魔术师完美无缺,你的大脑甚至意识不到戏法正在发生。它会接受幻觉为现实。
这项研究表明,我们的大脑拥有一条特定的“事实核查”路径,只有当我们有意识地意识到某事出错时,它才会被激活。如果人工智能足够好,能够绕过这种有意识的觉察,那么我们的甚至不知道自己已被愚弄。
这篇论文没有说明的内容:
- 它并没有说我们可以利用这一点来治疗疾病,或者在现实生活中实时读取人们的思想。
- 它并没有声称人工智能会变得“邪恶”。
- 它仅仅描绘了当我们成功识破谎言与当我们被谎言愚弄时,我们大脑所采取的电信号步骤。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。