Simulating Eating Disorder Patients with LLMs: Evaluating Psychological Persona Stability in Multi-Turn Conversations
这项研究表明,虽然大语言模型在对话中能保持一致的心理人格,但它们会通过选择性的刻板印象化过度提升严重程度评分,从而系统性地无法准确模拟进食障碍患者,进而仅捕捉到了极端的病理特征,却缺乏表现中度临床症状的细微差别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正在为一部关于进食障碍患者的戏剧选角的导演。你希望这些演员能够极其逼真,无论是在独自阅读剧本还是与搭档即兴表演时,都能完美地保持角色状态。同时,你也希望他们能精准地表现出剧本中所描述的确切严重程度——有些角色处于深度危机中,而另一些则处于中度的挣扎阶段。
你决定使用 AI 演员(大语言模型)而不是人类来完成这项工作。你给他们提供了一个详细的“角色传记”(提示词),并要求他们演绎这些角色的人生,并填写一份标准的饮食习惯医疗调查问卷。
这篇论文是导演对这些 AI 演员表现出的“成绩单”。研究结果令人惊讶、困惑且有些令人担忧。
主要发现:“过于稳定,但方向错了”
研究人员发现了一个悖论:这些 AI 演员表现得极其一致,但这种一致性却是错误的。
- 好消息(稳定性): 如果你让同一个 AI 演员扮演同一个角色 50 次,他们每次给出的答案几乎完全相同。他们不会忘记自己的身份。他们就像一个永不脱离角色的机器人。
- 坏消息(准确性): 尽管他们表现得很一致,但他们都在过度戏剧化。AI 模型将所有角色——无论是轻度挣扎还是严重危机的角色——全都变成了“极端”案例。
把这想象成收音机上的音量旋钮。研究人员希望 AI 能将音量调到代表中度病例的“5”,以及代表严重病例的“10”。然而,AI 却把音量调到了“9”或“10”,无论剧本是如何描述的。
“缺失的中段”
论文描述了一种被称为 “缺失的中段”(Missing Middle) 的现象。
- 严重病例: 当剧本描述一个非常严重的进食障碍时,AI 的表现大致正确。
- 中度病例: 当剧本描述一个处于中度挣扎的人(即许多真实患者所处的“中间”地带)时,AI 会夸大其词,使他们听起来像是处于严重的危机之中。
AI 似乎根本没有一个良好的“音量设置”来处理中度问题。它默认会切换到所有可用设置中最响亮、最具有戏剧性的那个。
“两部分”故障
为什么会发生这种情况?研究人员发现 AI 使用了一种奇怪的捷径,他们称之为 “选择性刻板印象”(Selective Stereotyping)。
想象一下,进食障碍调查问卷包含两类问题:
- 行为类问题: “你会限制进食吗?”“你会暴食吗?”
- 情感类问题: “你有多讨厌自己的身体?”“你对体重有多痴迷?”
AI 对这两类问题的处理方式不同:
- 对于行为: 它听从了剧本。如果角色是“暴食者”,AI 会说:“是的,我会暴食。”如果角色是“催吐者”,它会说:“是的,我会催吐。”它准确地把握了行为。
- 对于情感: 它忽略了剧本。无论角色是谁,AI 都假设所有人患有进食障碍时,都会对体重达到极度痴迷,并对身体产生极度的厌恶。它把“身体厌恶感”的旋钮直接拧到了顶峰。
因为情感问题对所有人来说都是满格的,所以 AI 无法区分中度病例和严重病例。这就像一位画家,虽然画对了衣服,但却给每一个人的脸上都涂抹了完全相同的极端绝望表情。
增加信息有用吗?
研究人员尝试给 AI 演员提供更详细的背景故事(童年创伤、家庭史、特定的生活事件),看看这是否能帮助他们更好地理解“中段”地带。
但这并没有奏效。 增加细节并没有解决问题。AI 仍然会默认进入极端的的情感设置。这似乎是由于 AI 的内部“训练数据”(它学习过的书籍和互联网内容)教会了它:“进食障碍 = 最大程度的身体厌恶”,而没有任何额外的上下文信息能够覆盖这条规则。
“观察者”问题
公平地说,研究人员不仅询问了 AI 如何感受,还要求其他 AI 模型来观察并评价这些演员。
- 结果: “观察者”AI 看到的正是“演员”AI 所表达的内容。它们也同样认为每个人都存在极度的身体不满。这证明了问题不仅仅在于演员在撒谎;问题在于整个表演本身就是建立在刻板印象之上的。
结论
论文总结道,虽然 AI 在保持一致性方面表现出色,但它目前尚未准备好去模拟人类进食障碍经历的全貌。
它可以很好地演绎一场严重的危机,但它无法捕捉中度挣扎中的细微差别。它就像一本词典,里面只有“愤怒”和“狂怒”这两个词,却没有“烦躁”或“不悦”这样的词汇。在 AI 学会如何为中度病例“调低音量”之前,它无法被信任去准确模拟临床谱系中的“中段”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。