GPT-4o reads the mind in the eyes
这项研究表明,GPT-4o 在从正立面孔中推断心理状态方面表现优于人类,但在倒置面孔上的表现较差,并表现出种族偏见,展示了其与人类认知相比,既具有类人化的认知特征,又存在截然不同且系统性的处理差异的复杂组合。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:AI 能否“察言观色”?
想象你正在参加一个派对。你看着一个人的眼睛,瞬间就能知道他是感到无聊、焦虑,还是在暗自发笑。人类是这方面的专家;我们只需看一眼眼睛,就能“读懂人心”。
这篇论文提出了一个简单的问题:一个超级聪明的计算机(GPT-4o)也能做到这一点吗?
研究人员不仅是让 AI 进行猜测,还让它接受了一项严苛的测试,称为“眼神识心测试”(Reading the Mind in the Eyes Test)。他们向 AI 和一组人类展示了眼睛的照片,并问道:“这个人的感受是什么?”答案必须从四个词的列表中做出选择(例如:焦虑、自信、讽刺、无聊)。
实验过程:倒置的把戏
为了观察 AI 和人类是如何思考的,研究人员使用了一个经典的技巧:他们将照片倒过来展示。
- 人类的反应: 当人类看到倒过来的脸时,就像是在尝试阅读一本几乎看不懂的外语书籍。这变得更难了,我们也更容易出错。但我们仍然使用同样的“心理词典”来猜测情绪。
- AI 的反应: 当脸部正向时,AI 在识别眼睛方面实际上比人类更出色。然而,当脸部被翻转过来时,AI 不仅仅是变得有些困惑;它完全迷失了方向。它的准确率大幅下降,甚至跌破了随机猜测的预期水平。
类比: 想象一个机器人和一个人正在尝试解一个谜题。
- 正向时: 机器人是个天才,解题的速度和准确度都超过了人类。
- 倒置时: 人类只是把谜题转了个面,然后继续尝试。而机器人却似乎完全忘记了谜题该怎么玩,甚至开始把碎片往墙上扔。
“偏见”问题:只看你想看到的
研究人员还测试了不同种族(白人和非白人)的面孔。
- 人类: 在这项研究中,人们在解读各种种族背景的人的眼神时表现得同样出色。
- AI: AI 在识别白人眼睛方面比识别非白人眼睛要好得多。这就像 AI 有一个它理解得更好的“优选”群体,这很可能是因为它接受的训练数据中包含更多这类面孔。
“错误”侦探工作:它们是如何出错的
这项研究中最引人入胜的部分不仅在于谁得到了正确答案,还在于它们是如何出错的。
把错误想象成雪地里的脚印。
- 人类的脚印: 当人类犯错时,他们的脚印是有些散乱的。如果他们把“害怕”猜成了“愤怒”,那么下次他们可能会猜“开心”。他们的错误在某种程度上是随机的,并且会根据情况而变化。
- AI 的脚印: AI 的脚印极其一致。如果它要犯错,它每次都会犯完全相同的错误。
- 转折点: 当脸部倒过来时,AI 并不是产生了随机的脚印。它形成了一种全新的、僵化的错误模式,这种模式与它在处理正向脸部时的错误模式完全不同。
结论: 人类在面对困难(倒置)时改变的是其“效率”,但使用的是同样的“逻辑”。而 AI 似乎在遇到困难时,切换到了另一种完全不同的、失效的逻辑。
错误中的“信息”
研究人员使用了一个数学概念——“信息论”来分析这些错误。他们发现,AI 的错误实际上比人类的错误包含更多信息。
类比:
- 人类的错误: 就像一个在考试中随机乱猜的学生。他们的错误答案无法告诉你他们在想什么。
- AI 的错误: 就像一个总是把“猫”和“狗”搞混,但绝不会把“猫”和“车”搞混的学生。尽管他们错了,但他们的模式能让你准确地了解他们的脑子(或代码)是如何连接概念的。AI 不仅仅是在猜测;它在持续地应用一套特定的、尽管是错误的规则手册。
研究结果总结
- 超人能力(但很脆弱): 当一切正常时,GPT-4o 在通过眼睛识别情绪方面表现得极其出色,甚至优于人类。
- 倒置效应: 当脸部倒置时,AI 的表现比人类崩溃得更加严重。
- 种族偏见: AI 对白人面孔的识别能力优于非白人面孔,而本研究中的人类则没有表现出这种差异。
- 系统性错误: AI 不会犯随机的错误。它会犯高度一致、有结构的错误,这些错误揭示了它处理信息的一种特定方式——这种方式与人类处理信息的方式有着本质的区别,尤其是在处理棘手输入(如倒置的脸部)时。
简而言之,AI 是一个聪明但刻板的学生。它记住了从训练数据中学习到的“正确”读脸方式,但当测试变得奇怪(倒置)或面孔看起来不同(不同种族)时,它不会像人类那样去适应,它只会机械地执行一个失效的剧本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。