← 最新论文
💻 computer science

A Survey of Large Language Models for Perception and Measurement of Human Psychology

本文对大语言模型作为人类心理测量工具进行了系统性综述,并提出了一个三维框架,旨在分析其在评估人格和心理健康等构念方面的理论合理性、方法论路径及实际有效性。

原作者: Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位超级聪明、博学多才的机器人图书管理员。这位图书管理员读过几乎所有被写下来的书籍、文章和推文。现在,想象一下你想利用这位图书管理员来理解人类的心智——具体来说,就是通过阅读某人的文字,来弄清楚一个人的性格、情绪,或者是否正面临心理健康问题。

这篇论文是对这一构想的大规模综述。它在问:这个机器人图书管理员真的能胜任测量人类心理的工作吗?

以下是该论文内容的拆解,使用了简单的类比:

1. 核心问题:这个图书管理员是“真实的”吗?

在我们让机器人来测量我们之前,我们必须先问:机器人是真的“理解”了我们,还是仅仅是一个模仿大师?

  • 争论: 有些人认为机器人只是一个“统计学鹦鹉”。它没有情感或灵魂;它只是根据在其训练数据中看到的模式来预测下一个词。
  • 证据: 然而,论文显示,当你给机器人一个“心理理论”(Theory of Mind)测试(比如询问它猜测故事中某个角色在想什么)时,它通常能答对,表现得像一个 6 到 9 岁的儿童甚至成年人一样。
  • 结论: 机器人已经发展出了“功能性”理解。它表现得像是理解人类思想一样,尽管我们并不清楚它是如何做到的。这使它成为一个充满前景的工具,但我们不应将其视为人类。

2. 我们如何使用这个机器人?(三种工具)

论文将研究人员使用这些模型的方式归纳为三种主要的“工具”:

  • 工具 A:主动访谈者(聊天机器人)
    • 运作方式: 机器人向你提问,就像治疗师或求职面试官一样。如果你的回答很模糊,它可以进行追问。
    • 类比: 把这想象成一个非常快速、不知疲倦的面试官,它可以同时与成千上万的人交谈。它使用“提示词”(指令)来决定下一步问什么。
  • 工具 B:被动观察者(社交媒体追踪者)
    • 运作方式: 机器人阅读你已经写下的内容——比如你的日记、推文或 Facebook 帖子——而无需你直接与其对话。
    • 类比: 想象一位侦探通过阅读你的旧信件来了解你的性格。它寻找你用词中的隐藏模式,以推测你是快乐、悲伤还是压力巨大。
  • 工具 C:多感官侦探(融合技术)
    • 运作方式: 机器人不仅阅读文本;它还会同时观察图片、聆听语音录音并检查心率数据。
    • 类比: 这就像一位医生,在阅读病历的同时,还在倾听你的声音、观察你的面部表情,从而获得全貌,而不是仅仅看一张表格。

3. 机器人目前测量了什么?

论文回顾了这项技术在哪些领域进行了测试:

  • 人格: 机器人通过你的文字来猜测“大五人格”特质(如你是外向还是内向)的能力正在提高。在某些测试中,它的猜测与人类对自身的描述吻契合得相当好。
  • 心理健康: 它能识别出文本中抑郁、焦虑甚至自杀念头的迹象。它正在成为一种有用的“预警系统”,可以标记出那些可能需要帮助的人。
  • “虚拟受试者”: 有趣的是,研究人员也在利用机器人来“扮演”人类。他们告诉机器人:“扮演一个压力很大的 30 岁女性”,然后机器人会生成相应的回应。这有助于科学家在不需要真实人类志愿者的情况下进行实验,从而节省时间和成本。

4. 症结所在:为什么我们还不能信任它

论文非常谨慎地指出,虽然机器人令人印象深刻,但它尚未准备好取代人类医生或心理学家。以下是主要的问题:

  • “反复无常的朋友”问题(可靠性): 如果你两次询问机器人同一个问题,它可能会给出两个不同的答案。它对你提问的方式非常敏感。措辞的微小变化可能会彻底改变结果。这对于需要一致性的医疗测试来说是很糟糕的。
  • “幻觉”问题: 有时机器人会编造事实。它可能听起来既自信又逻辑严密,但它可能正在捏造事实或误读一场危机。在心理健康场景中,错误的判断可能是危险的。
  • “偏见”问题: 机器人的学习素材主要来自英语母语的西方互联网数据。如果你用它来对待来自不同文化或背景的人,它可能会误解他们或产生不公平的判断,因为它并不“理解”其文化背景。
  • “黑箱”问题: 当人类医生做出诊断时,他们可以解释自己的推理过程。而当机器人做出判断时,人们往往很难知道它为什么会那样决定。医生需要知道“为什么”才能信任结果。

5. 总结

论文的结论是,大语言模型就像是功能强大的高科技助手,而非人类专家的替代品。

  • 它们的优势在于: 它们速度快、成本相对较低,并且可以处理海量数据。它们非常适合用于大规模人群的筛查,或帮助研究人员进行实验。
  • 它们的劣势在于: 它们不够稳定、不够透明,也不具备足够的文化敏感性,无法独立做出关乎生死的医疗决策。

最终类比:
把机器人想象成一名非常有天赋的实习医生。它读过所有的教科书,并且能迅速发现症状。但它缺乏资深医生所拥有的经验、一致性和伦理判断力。目前,机器人的作用应该是辅助资深医生更好地完成工作,而不是完全接管这份工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →