Inferring personality from a live interaction with an LLM: Predictions are internally consistent and show convergent validity
这项预注册研究表明,大语言模型能够从实时对话中可靠地推断出大五人格特质,并具有较高的内部一致性和收敛效度,尤其是在神经质和宜人性方面,尽管其表现会因特质的可观测性和提示策略而异。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,心理学家一直依赖一种简单的工具来了解我们是谁:问卷调查。人们坐下来对一系列陈述进行评分,回答自己对于外向、有组织性或焦虑等想法的认同或反对程度。这种方法效率很高,并为我们提供了一张标准的性格图谱,通常被称为“大五人格”。这五种特质——开放性、尽责性、外向性、宜人性以及神经质——构成了一个描述人们如何思考、感受和行为的框架。然而,这种方法存在缺陷。它要求人们向内审视并评价自己,这一过程可能会受到人们希望被如何看待的愿望,或是简单的自我反思错误的干扰。它也忽略了我们在现实世界中如何交谈和互动的那些丰富而复杂的细节。
最近,一种新的技术出现了,它可能会改变我们衡量这些特质的方式。大语言模型是经过海量文本训练的计算机程序,能够进行感觉异常接近人类的对话。因为这些模型阅读了大量的文字,它们有时能发现人们使用语言时所呈现出的模式,从而揭示其潜在的性格特征。研究人员开始提出的问题是:计算机是否可以通过聆听一个人的实时对话,仅仅通过听他们说话,就能准确地猜出其人格,而无需他们填写任何表格?
波恩大学的一个研究小组致力于测试这个想法。他们邀请了117人与一个人工智能聊天机器人进行十分钟的对话。该聊天机器人收到了一个特定的指令:针对参与者过去一周的情况提出开放式问题,同时保持自己的回答简洁,并试图收集足够的信息来理解这个人的性格。目标是观察计算机是否能从这段简短的交流中提取出人格剖面。在对话结束后,研究人员要求聊天机器人根据这五种主要特质对参与者进行评估。为了确保结果可靠,研究人员还要求参与者填写一份标准的性格问卷来描述自己,以此作为对比计算机猜测的基准。
研究人员测试了两种不同的询问计算机进行判断的方式。在第一种方法中,他们只是要求模型根据对话对该人的五种特质进行评分。在第二种更复杂的方法中,他们将标准性格测试的精确问题列表输入给计算机,并要求它猜测该人会对每一个问题如何回答。结果显示,计算机完成这项任务的效果惊人地好。当研究人员检查计算机评分的一致性时,他们发现该模型对人格结构的理解与人类心理学家一样出色。计算机生成的评分具有内部一致性,这意味着它不会对同一个人给出矛盾的答案。
更重要的是,计算机的评估与参与者的自我报告相匹配。最强的匹配出现在神经质(涉及情绪稳定性和焦虑)和宜人性(涉及善良和合作)方面。计算机在捕捉人们言语中的抑郁和同情迹象方面表现得尤为出色。然而,这项技术在其他特质上遇到了困难。它较难预测一个人是多么外向或开明。这种困难可能源于对话本身的性质。像外向性这样的特质通常体现在人们在群体中的表现或其精力充沛程度方面,而这些在与机器的文本聊天中很难捕捉。同样,创造力和开放性通常是内在的过程,并不总是在简短的对话中留下清晰的痕迹。
研究还观察了计算机是否存在偏见。曾有一种担忧,即模型可能会依赖刻板印象,例如仅仅因为它在训练数据中读到过这些观点,就假设女性比男性更感性。然而,由于研究人员向聊天机器人隐藏了参与者的性别,计算机并没有放大这些刻板印象。它发现的男女差异与参与者对自己描述的内容是一致的,这表明模型是对真实的人做出反应,而非基于先入为主的观念。不过,研究人员确实发现计算机在判断时倾向于过于宽容。它给出了更高的宜人性、尽责性评分,以及更低的神经质评分,这可能是因为它被编程为要表现得礼貌,或者它默认采用了一种“友好”的版本来描述一个人。
虽然计算机的预测并不完美,但这项研究表明,我们正朝着通过自然对话而非仅仅通过清单来理解人格的未来迈进。研究人员发现,要求进行一般性评分的简单方法比输入测试问题的复杂方法效果更好,后者会导致系统更容易失败。这表明该模型拥有一种直觉性的性格理解力,并不总是需要一个僵化的框架来运作。研究结果表明,虽然这些工具尚未准备好取代人类心理学家或做出改变生活的决策,但它们可以成功地从我们选择的措辞中提取出关于我们是谁的有意义信号。随着技术的进步,以及对话变得更长、更详细,通过言语解读人格的能力可能会成为理解人类心灵的一种强大新方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。