← 最新论文
💬 NLP

Detection != Reliable Control: Decodable Empathy Directions Yield at Most Partial Shifts in Automated Empathy Scores

本文表明,尽管指令微调的大语言模型中可解码的共情方向能够可靠地检测并部分改变自动化共情评分,但它们并不构成实现全面控制的可靠因果杠杆,特别是在无法产生可衡量的真人感知变化,以及在不同共情维度和模型之间无法产生一致效果方面表现出局限性。

原作者: Haoran Jisun

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoran Jisun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界里,研究人员正日益关注机器是否真的能理解人类情感。一个流行的观点认为,如果我们能在计算机的大脑中找到一个与“共情”这类感受相对应的特定模式,我们应该就能通过转动一个旋钮来让机器表达出更多的共情。这一概念依赖于这样一种信念:如果一台计算机可以被“读取”以显示它具有某种特质,那么它也可以被“操控”以随心所欲地改变该特质。随着这些系统正被部署用于为处于困境中的人们提供情感支持,这一点显得尤为重要,因为在这些场景下,有帮助的回应与冷漠的回应之间的差别可能非常显著。然而,关于检测机器内部的情感是否等同于能够可靠地控制这种情感的假设,从未在复杂的现实世界语境下的共情领域中得到过严格测试。

来自南加州大学的一项新研究通过检查三种不同的语言大模型(即许多现代聊天机器人背后的强大人工智能系统)挑战了这一假设。研究人员将重点放在了心理学家长期认可的共情的两个不同部分:理解他人观点的能力,即认知共情(cognitive empathy);以及分享或产生情感共鸣的能力,即情感共情(affective empathy)。团队首先确认,他们确实可以在 AI 模型的内部运作中检测到这两种特质的信号。他们发现,在计算机的数据中存在特定的方向,能够清晰地将表现出高共情和低共情的响应区分开来。这种检测效果良好,表明这些模型确实拥有这些概念的内部表征。

然而,关键的测试在于,向这些检测到的信号方向施加一个小小的“推力”,是否真的能以有意义的方式改变 AI 的行为。研究人员应用了这些推力,实际上是在尝试引导模型变得更具共情心,然后使用多个自动化评判工具和一个专门的分类器来衡量结果。结果揭示了这两类共情之间的鲜明分歧。当团队试图增加情感共鸣时,他们观察到了可衡量的变化,但这种变化只是部分的。在表现最好的模型中,干预措施将共情得分提高了大约四分之一(即在中性响应与完全共情响应之间的自然差距中)。AI 并未变得完全共情,它只是向那个方向发生了轻微的偏移。在测试的其他模型中,这种效果甚至更小,有时几乎察觉不到。

对于认知共情——即理解并阐述他人处境的能力——情况则有所不同。研究人员发现,无论他们如何尝试引导模型,自动化的评分都没有发生变化。然而,这项研究提供了一个至关重要的细微差别:这种缺乏变化并不一定证明 AI 无法变得更有共情心。相反,研究发现用于衡量认知共情的工具过于粗糙,无法检测出干预可能创造出的微妙差异。这些测量工具可以分辨出完全中性的信息与高度情感化的信息之间的区别,但无法可靠地辨别情感支持领域内不同水平的理解程度。由于测量工具本身不够敏感,研究人员得出结论:这种引导的效果是“无法测量”,而非“证明为零”。

或许最重要的一点是,研究发现,即使自动化评分发生了偏移,也没有证据表明人类读者会感知到这种变化。一组人类志愿者被要求对受引导后的响应进行评判,但他们未能一致地识别出哪些响应更具共情心。这表明,AI 所做的改变并不是人类会注意到或重视的那种转变。研究人员还测试了完全移除这些共情信号是否会让 AI 变得缺乏共情。在其中一个特定模型中,移除认知理解的信号确实降低了评分,但这种效应与 AI 写出的文本长度有关,而测量工具恰好会对篇幅较短的文本进行惩罚。当研究人员考虑了文本长度后,对认知评分的影响依然存在,但这仍然不是一个可以用来控制 AI 行为的、干净且可靠的开关。

最终,这项研究表明,在 AI 内部发现共情信号并不等同于拥有能够产生共情的可靠控制手段。虽然模型可以被引导以表现出略微更多的情感共鸣,但这种效果是有限的,并且不会转化为人类感知的提升。检测出一种特质并不保证能够操控它,尤其是当用于衡量结果的工具不够精细,无法观察到这些变化时。这一发现为那些希望部署 AI 进行情感支持的人提供了警示,表明仅仅调高共情的“旋钮”可能无法产生所需的真正、类人的连接。该研究强调了“机器能说什么”与“人类实际体验到的共情”之间的差距,敦促人们在衡量和控制这些复杂行为时采取更加谨慎的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →