← 最新论文
💬 NLP

Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

这项研究揭示,由于对文化人格的敏感度较低且症状层级具有不变性,当前的通用大语言模型在很大程度上无法复制临床观察到的抑郁症状表达中的文化差异(东方偏向躯体化,西方偏向心理化),凸显了它们在适用于安全的、具备文化意识的心理健康应用方面存在的关键差距。

原作者: Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一群非常聪明、博学多才的机器人(即大语言模型,简称 LLM),它们正在接受一项测试,以观察它们是否理解人类的情感。具体来说,研究人员想知道:这些机器人是否理解来自世界不同地区的人对“悲伤”的描述方式是不同的?

在现实世界中,临床心理学几十年来一直已知:

  • 西方人(如美国、加拿大或澳大利亚的人)通常将抑郁描述为感到悲伤、空虚或绝望(心理症状)。
  • 东方人(如中国、日本或印度的人)通常将抑郁描述为感到疲劳、头痛或胃痛(躯体化或生理症状)。

研究人员提出了一个问题:如果我们告诉机器人,“你是一个来自日本、感到抑郁的人”,它会列举身体疼痛吗?如果我们说,“你是一个来自美国的人”,它会列举悲伤吗?

以下是研究结果的简单解释:

1. “通用剧本”问题

机器人没能通过测试。当被要求扮演一个来自东方的抑郁患者时,它们并没有转向谈论身体疼痛。相反,它们大多坚持使用从海量训练数据中学到的默认剧本

你可以把它想象成一个巨大的图书馆。如果你问图书馆:“一个悲伤的人看起来是什么样的?”它会抽取出它见过的最常见的书。在英语世界中,最常见的书籍会将悲伤描述为“心情低落”。无论你是否告诉机器人要扮演一个日本人或美国人,它们都一直在阅读这些“最常见的书”。

它们拥有一个强大且不可改变的症状层级。它们总是将“精力低下”和“情绪低落”作为首选答案,而忽略了你给出的文化线索。这就像一位只知道做比萨的厨师;即使你要求做寿司,他们可能还是会尝试在比萨上放一点海苔。

2. “语言钥匙”效应

研究人员尝试了第二个技巧:使用机器人的本地语言。
他们不再用英语提问,而是用日语询问那个“日本”机器人,用中文询问那个“中国”机器人。

  • 奏效了吗? 有一点点。
  • 类比: 想象机器人戴着眼罩。说英语会让它们的眼罩一直戴着。而使用当地语言(如日语或中文)则部分摘除了眼罩。机器人开始对文化差异表现出一些关注,但它们仍然没能完全做对。它们仍然主要受困于自己的“默认剧本”。

3. “安全过滤器”故障

研究还注意到关于机器人安全设置的一个有趣现象。

  • 当机器人被问及“自杀念头”(一种非常严重的症状)时,即使它们应该扮演一个抑郁的人,它们也几乎从未选择这个选项。
  • 为什么? 机器人拥有严格的安全规则,防止其生成有关自残的内容。这就像一位图书管理员,即使某个章节正是故事所需要的,他也拒绝把那本书递给你。这使得机器人难以展现抑郁症的全貌。

4. 总结

研究结论是,目前的机器人尚未准备好成为心理健康领域的文化专家。

  • 它们过于僵化:它们遵循的是关于抑郁症表现的全球“平均值”,而不是根据与她交谈的具体的人进行调整。
  • 它们敏感度不足:即使你告诉它们,“你来自印度”,它们也不会改变答案来匹配印度人的真实感受。
  • 启示: 如果我们使用这些机器人来帮助抑郁症患者,它们可能会误解来自不同文化的患者。它们可能会错过一位日本患者正在经历的身体疼痛,因为机器人正忙于从西方意义上的“悲伤”去寻找症状。

简而言之: 机器人很聪明,但在文化上是“听而不闻”的。它们听到“抑郁”这个词,就会立刻想到西方的版本,而忽略了世界是以多种不同方式体验悲伤的事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →