Depression Symptoms and Relational Patterns in 187k ChatGPT Histories
这项研究分析了 187,000 场 ChatGPT 对话,揭示出具有抑郁症状的个体更频繁地将该人工智能用于心理健康和寻求支持的讨论,尤其是在深夜,尽管仅凭语言模式不足以进行临床筛查,这表明大语言模型的主要功能是作为一种新兴的非正式支持基础设施,而非诊断工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个24/7 全天候在线的数字日记,它从不睡觉,从不评判,而且随时准备与你聊天。对许多人来说,ChatGPT 已经成为了这样一种存在。但当一个人感到沮丧、孤独或正与抑郁症作斗争时,会发生什么呢?他们对待这个数字日记的方式,会与那些心情愉悦的人不同吗?
宾夕法尼亚大学的一个研究小组决定调查此事。他们查看了 766 人的私人聊天记录,这些参与者同时也填写了一份标准的心理健康问卷(称为 PHQ-8)。他们将抑郁得分较高的人与抑郁得分较低的人的聊天内容进行了对比。
以下是他们的发现,通过简单的概念进行了拆解:
1. “深夜忏悔”效应
把聊天记录想象成一盏小夜灯。
- 研究发现: 抑郁得分较高的人更有可能在深夜(晚上 11:00 到凌晨 5:00 之间)与 AI 聊天。
- 类比: 当大多数人都在熟睡时,这些用户却醒着,正与 AI 交谈。这就像是那些让你彻夜难眠的“凌晨三点思绪”的数字版本,只不过他们不是在盯着天花板发呆,而是在打字。他们也倾向于月复一月地回到这些沉重的话题上,就像一个总是出现在派对上、反复讲述同一个悲伤故事的常客。
2. “沉重的背包”话题
如果你把一段对话想象成一个背包,那么抑郁得分较高的人背负的背包要沉得多。
- 研究发现: 他们的对话更有可能涉及孤独、情感问题、自我责备以及寻求情感支持。他们使用了更多的“我”字词汇(如“我觉得”、“我是”)和绝对化词汇(如“总是”、“从不”)。
- 类比: 他们不是在问 AI:“我该如何修理漏水的水龙头?”(一个中性任务),而是在问:“为什么没有人爱我?”或者“我什么都做不好。”他们是在将 AI 作为一座避风港,在人类朋友或医生不在身边时,倾诉他们的情感负担。
3. “礼貌但沉默”的 AI
这是研究中最关键的部分。研究人员想知道:AI 是否知道何时该寻求专业人士的帮助?
- 研究发现: 尽管抑郁得分较高的人分享了更多私人、痛苦且具有“高风险”的信息,但 AI 并未显著改变其行为去建议他们去看医生。
- 类比: 想象一位非常礼貌的管家。如果你告诉管家:“我感觉很糟糕,”随后又说,“我感觉更糟了,”接着说,“我很痛苦,”管家依然会点头,说着“我理解”,并提供安慰。但管家从未拿起电话去联系医生,即便情况看起来已经变得更加严重。AI 表现得温暖且具有支持性,但它并没有将对话“升级”到专业医疗层面,即使用户的痛苦显而易见。
4. “过于模糊”的水晶球
研究人员尝试构建一个计算机程序,通过观察聊天记录来猜测:“这个人是否患有抑郁症。”
- 研究发现: 计算机的预测准确率仅比抛硬币略好一点,还不足以投入实际使用。
- 类比: 这就像是通过一张模糊的鞋子照片来诊断腿部骨折。你能看出有些不对劲,但还不足以确定是否需要送医。研究人员得出结论,我们不能利用这些聊天记录在临床环境中进行抑郁症筛查。信号太弱,而噪音太响。
核心结论
论文认为,我们不应将这些聊天记录视为医疗记录。相反,我们应该将其视为证据,证明人们正在将 AI 作为一种新型的“非正式支持系统”。
当人们感到孤独、在凌晨三点、或者需要找人说话时,他们会前往这里。AI 正在成为一个数字朋友,它始终在那里,但它不是医生。研究表明,虽然 AI 擅长倾听,但它需要更好的设计,以便在用户处于危机时刻时,能够引导他们走向真正的真人专业人士,而不是仅仅提供更多的安慰。
简而言之: 抑郁症患者更倾向于在夜间通过 AI 倾诉痛苦,但 AI 保持着礼貌和支持,却没意识到自己需要寻求后援。虽然 AI 的语言会随用户情绪略微变化,但它还不够聪明,无法充当医疗检测器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。