All four leading LLMs talk more than they listen to personality-verified synthetic help-seekers
本文揭示了四种领先的大型语言模型无法区分在危机场景中经过人格验证的合成求助者,始终表现出过度冗长和过早解决问题的倾向,而非有效的倾听或情绪稳定。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当一个人面临突如其来的、压倒性的危机时——例如得知亲人被诊断出患有痴呆症——他们的思维方式会发生可预见的改变。剧烈的压力会使他们的注意力变得狭窄,导致难以处理新信息或理解冗长的解释。在这些时刻,最有效的心理支持遵循一种特定的节奏:先通过倾听来稳定对方的情绪,随后才提供解决方案或建议。如今,许多人在这些痛苦时刻会转向人工智能聊天机器人寻求帮助,希望能获得清晰的思路与慰藉。然而,这些数字助手通常旨在通过快速提供信息来体现“乐于助人”,这可能导致它们说话过多并过早地解决问题,从而可能让那些已经在挣扎中难以跟上节奏的用户感到不知所措。
伦敦帝国理工学院和马德里自治大学的研究团队致力于测试当今最先进的人工智能模型是否真的能够适应这种“多听少说”的人类需求。他们构建了一个复杂的模拟系统,作为一个安全的测试场。为了避免让处于危机中的真人承担风险,他们创建了七个合成的“求助者”,每个求助者都根据不同的心理特征进行了编程。这些画像并非模糊的描述,而是基于成熟的科学测量手段,涵盖了人格、应对风格和韧性。这些数字角色被置于一个场景中:他们刚刚得知亲人被诊断出患有痴呆症。随后,他们与四种世界领先的语言模型进行了十轮对话,这些模型扮演着试图提供支持的“顾问”。
为了确保结果的客观性,研究人员引入了第三个角色:一个独立的“审计员”。这个审计员是另一个人工智能模型,它在不知道求助者心理特征的情况下倾听整个对话过程。它的职责是判断顾问是否成功地进行了倾听,是否稳定了对方的情绪,以及是否避免了诸如过早给出建议或说话过多等常见陷阱。研究人员还检查了合成求助者的行为是否与其分配的人格保持一致,即观察者是否仅通过阅读聊天记录就能分辨出其身份。
研究揭示了在测试的所有四个人工智能模型中存在的一个显著且一致的模式。无论哪种模型扮演顾问角色,它们说话都比倾听多。在每一场对话中,顾问说出的词数都多于求助者,顾问与用户的词数比例从接近二比一到超过三比一不等。此外,所有四个模型都倾向于在用户完成情况说明或表达感受之前就急于进入问题解决阶段。这种行为违背了专家对危机支持的认知,即在危机支持中,首要任务是让当事人感到被倾听并冷静下来,然后再提供任何解决方案。研究人员发现,这种过度冗长且以解决问题为导向的倾向是一种共同的失效模式,而非单个模型的特质。
尽管存在这一共同缺陷,研究确实发现可以通过支持质量将这些模型区分开来。其中一个模型 DeepSeek-V3.2 的表现略优于其他模型,它展现出更强的支持用户自主感与胜任感的能力,同时产生的反效果行为较少。然而,顶尖模型之间的差距很小,且没有一个模型达到了可以被称为“完美”的表现水平。研究还证实了合成求助者的成功:独立审计员仅通过阅读对话,就能准确识别出求助者的特定心理特征,这证明了这些数字角色能够可靠地塑造复杂的人类人格。
研究结果表明,虽然当前的人工智能系统能够进行复杂的、多轮次的对话,但它们尚未学会危机支持中所必需的“克制”技巧。它们仍然过于渴望表达和解决问题,这种特质在许多语境下可能很有用,但在一个人处于急性痛苦且处理信息能力有限时却是有害的。研究人员得出结论,若要使这些工具在涉及高风险的情况时真正安全且有效,就需要对其进行重新校准,使其优先考虑倾听与简洁,从而模仿资深人类咨询师的耐心,而非搜索引擎的高效。这项工作为在这些系统部署用于帮助处于脆弱时刻的真实人类之前,提供了一种新的、安全的方法来测试并改进它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。