← 最新论文
💻 computer science

GPT-4o reads the mind in the eyes

这项研究表明,GPT-4o 在从正立面孔中推断心理状态方面表现优于人类,但在倒置面孔上的表现较差,并表现出种族偏见,展示了其与人类认知相比,既具有类人化的认知特征,又存在截然不同且系统性的处理差异的复杂组合。

原作者: James W. A. Strachan, Oriana Pansardi, Eugenio Scaliti, Marco Celotto, Krati Saxena, Chunzhi Yi, Fabio Manzi, Alessandro Rufo, Guido Manzi, Michael S. A. Graziano, Stefano Panzeri, Cristina Becchio

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: James W. A. Strachan, Oriana Pansardi, Eugenio Scaliti, Marco Celotto, Krati Saxena, Chunzhi Yi, Fabio Manzi, Alessandro Rufo, Guido Manzi, Michael S. A. Graziano, Stefano Panzeri, Cristina Becchio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:AI 能否“察言观色”?

想象你正在参加一个派对。你看着一个人的眼睛,瞬间就能知道他是感到无聊、焦虑,还是在暗自发笑。人类是这方面的专家;我们只需看一眼眼睛,就能“读懂人心”。

这篇论文提出了一个简单的问题:一个超级聪明的计算机(GPT-4o)也能做到这一点吗?

研究人员不仅是让 AI 进行猜测,还让它接受了一项严苛的测试,称为“眼神识心测试”(Reading the Mind in the Eyes Test)。他们向 AI 和一组人类展示了眼睛的照片,并问道:“这个人的感受是什么?”答案必须从四个词的列表中做出选择(例如:焦虑、自信、讽刺、无聊)。

实验过程:倒置的把戏

为了观察 AI 和人类是如何思考的,研究人员使用了一个经典的技巧:他们将照片倒过来展示

  • 人类的反应: 当人类看到倒过来的脸时,就像是在尝试阅读一本几乎看不懂的外语书籍。这变得更难了,我们也更容易出错。但我们仍然使用同样的“心理词典”来猜测情绪。
  • AI 的反应: 当脸部正向时,AI 在识别眼睛方面实际上比人类更出色。然而,当脸部被翻转过来时,AI 不仅仅是变得有些困惑;它完全迷失了方向。它的准确率大幅下降,甚至跌破了随机猜测的预期水平。

类比: 想象一个机器人和一个人正在尝试解一个谜题。

  • 正向时: 机器人是个天才,解题的速度和准确度都超过了人类。
  • 倒置时: 人类只是把谜题转了个面,然后继续尝试。而机器人却似乎完全忘记了谜题该怎么玩,甚至开始把碎片往墙上扔。

“偏见”问题:只看你想看到的

研究人员还测试了不同种族(白人和非白人)的面孔。

  • 人类: 在这项研究中,人们在解读各种种族背景的人的眼神时表现得同样出色。
  • AI: AI 在识别白人眼睛方面比识别非白人眼睛要好得多。这就像 AI 有一个它理解得更好的“优选”群体,这很可能是因为它接受的训练数据中包含更多这类面孔。

“错误”侦探工作:它们是如何出错的

这项研究中最引人入胜的部分不仅在于谁得到了正确答案,还在于它们是如何出错的

把错误想象成雪地里的脚印。

  • 人类的脚印: 当人类犯错时,他们的脚印是有些散乱的。如果他们把“害怕”猜成了“愤怒”,那么下次他们可能会猜“开心”。他们的错误在某种程度上是随机的,并且会根据情况而变化。
  • AI 的脚印: AI 的脚印极其一致。如果它要犯错,它每次都会犯完全相同的错误。
    • 转折点: 当脸部倒过来时,AI 并不是产生了随机的脚印。它形成了一种全新的、僵化的错误模式,这种模式与它在处理正向脸部时的错误模式完全不同。

结论: 人类在面对困难(倒置)时改变的是其“效率”,但使用的是同样的“逻辑”。而 AI 似乎在遇到困难时,切换到了另一种完全不同的、失效的逻辑。

错误中的“信息”

研究人员使用了一个数学概念——“信息论”来分析这些错误。他们发现,AI 的错误实际上比人类的错误包含更多信息

类比:

  • 人类的错误: 就像一个在考试中随机乱猜的学生。他们的错误答案无法告诉你他们在想什么。
  • AI 的错误: 就像一个总是把“猫”和“狗”搞混,但绝不会把“猫”和“车”搞混的学生。尽管他们错了,但他们的模式能让你准确地了解他们的脑子(或代码)是如何连接概念的。AI 不仅仅是在猜测;它在持续地应用一套特定的、尽管是错误的规则手册。

研究结果总结

  1. 超人能力(但很脆弱): 当一切正常时,GPT-4o 在通过眼睛识别情绪方面表现得极其出色,甚至优于人类。
  2. 倒置效应: 当脸部倒置时,AI 的表现比人类崩溃得更加严重。
  3. 种族偏见: AI 对白人面孔的识别能力优于非白人面孔,而本研究中的人类则没有表现出这种差异。
  4. 系统性错误: AI 不会犯随机的错误。它会犯高度一致、有结构的错误,这些错误揭示了它处理信息的一种特定方式——这种方式与人类处理信息的方式有着本质的区别,尤其是在处理棘手输入(如倒置的脸部)时。

简而言之,AI 是一个聪明但刻板的学生。它记住了从训练数据中学习到的“正确”读脸方式,但当测试变得奇怪(倒置)或面孔看起来不同(不同种族)时,它不会像人类那样去适应,它只会机械地执行一个失效的剧本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →