Beauty is in the ELBO of the Beholder: A Variational Account of Processing Fluency in Face Perception
本文表明,人类对面部吸引力的判断与在无监督条件下训练的变分自编码器的证据下界(ELBO)相一致,这为审美愉悦源于对统计规律性、原型化面部的处理流畅性这一理论提供了经验性支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
几十年来,科学家们一直在思考,为什么有些面孔能吸引我们,而另一些则显得平庸无奇。人类感知的理论长期以来一直表明,美不仅仅是个人品味的问题,而是深深植根于我们大脑处理视觉信息的难易程度之中。当一张脸是对称的、平均的或熟悉的,我们的思维似乎能以更少的努力来识别它,这种现象被称为“处理流畅性”(processing fluency)。这种理解的便捷性被认为会产生一种愉悦感,从而引导我们将这些面孔评定为更具吸引力。虽然这一观点已在无数针对人类受试者的行为实验中得到了验证,但这种心理上的轻松感究竟是如何在复杂的学习机制内部产生的,仍然是一个谜。一台仅通过观察面孔而从未被告知哪些面孔是美丽的计算机,能否也发展出类似的偏好感?
为了回答这个问题,研究人员弗朗西斯科·洛佩斯(Francisco López)和约亨·特里施(Jochen Triesch)转向了一种被称为“变分自编码器”(variational autoencoder)的人工智能类型。这些机器旨在学习数据的底层结构,例如成千上万张人类面孔的照片,而无需任何关于美感的真人指导或标签。该系统通过尝试将一张脸压缩成一个简化的内部代码,然后再从该代码中重建这张脸来进行工作。为了成功实现这一点,机器必须平衡两个相互竞争的目标:它既需要保留足够的细节以准确地重建面孔,也需要保持内部代码的简洁与有序。研究人员提出,用于衡量机器如何平衡这两个目标的数学评分,是人类处理流畅性的直接计算版本。如果一张脸对于机器来说易于理解和重建,那么它在该指标上的得分就会很高。
团队在四个不同的面孔图像大型集合上训练了四个独立的 AI 模型,确保没有任何一个模型见过人类对吸引力的评分。随后,他们使用芝加哥面孔数据库中的 597 张标准面孔对这些模型进行了测试,而这些面孔的人类吸引力评分是已知的。结果令人震惊。人类评定为最美丽的那些面孔,始终是机器处理起来最容易的面孔。在机器组织面孔的数学空间中,美感增加的方向与处理便捷度增加的方向几乎完美契合。无论机器是在哪个数据集上训练的,还是所涉及的面孔属于哪个特定的人口统计群体,这种一致性都成立。机器不需要被教导什么是美;它仅仅通过学习如何高效地观察面孔,就发现了一条通往美的路径。
此外,研究人员发现,这种偏好不仅是一个单一的数字,而且是机器内部地图中的一个特定方向。当他们比较不同模型创建的地图时,发现“美感方向”具有显著的一致性。尽管这些模型是从不同的起点和不同的训练数据开始从头构建的,但它们都以一种指向相同吸引力概念的方式来组织面孔。这表明,人类的美感并非一种随机的文化建构,而是与面孔在被呈现方式上的基本且可复现的结构紧密相连。研究还证实,具有吸引力的面孔往往更具“原型性”(prototypical),这意味着它们看起来更像其所属群体的平均面孔,无论是在物理形状上还是在机器的内部代码中。然而,机器预测美的能力超越了简单的平均值,捕捉到了基础几何平均值可能会忽略的微妙细节。
这些发现为古老的审美理论与现代人工智能之间搭建了一座新的桥梁。它们表明,我们在看到一张美丽的脸时所感受到的愉悦,可能源于使机器能够以最小误差压缩并重建图像的那种效率。机器在没有任何人类指令的情况下成功预测人类偏好的能力意味着,我们对某些面孔的吸引力与我们的思维理解它们之易程度有着深刻的联系。虽然这项研究并不声称人类大脑的工作方式与这些计算机模型完全相同,但它提供了强有力的证据,证明高效表征的原则是这一故事的关键部分。研究结论认为,在面孔感知的语境下,美确实在于观察者的眼中,但那只眼睛是由一种关于信息如何被处理和理解的深层且共享的逻辑所引导的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。