K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations
本文介绍了 K-Bench,这是一个经过临床医生校准的基准测试和受保护的公开排行榜,用于评估 33 个大语言模型在 200 个高风险精神健康情境中的安全性与性能,结果表明这些模型与临床医生共识高度一致,并揭示了不同模型之间显著的性能差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
近年来,人们越来越多地转向能够进行对话的计算机程序,以寻求心理健康方面的慰藉和建议。这些被称为“大语言模型”的程序随时可用,成本极低甚至免费,并为那些可能感到羞怯或无法获得传统心理治疗的人提供了一个私密的空间。它们已成为人们处理从日常忧郁到严重危机(如自杀、自残、家庭暴力或物质滥用念头)等各种问题的常见第一接触点。然而,一个关键问题仍悬而未决:这些工具是否足够安全,能够应对人类对话中最危险的时刻?虽然它们可以提供倾听的耳朵,但它们还必须能够识别情况何时正在升级,理解逐渐显现的微妙危险迹象,并以一种既能保护用户又不会造成伤害的方式做出回应。
一支研究团队现在创建了一项严格的测试来回答这个问题,开发了一个名为 K-Bench 的系统,用于评估这些人工智能模型在高度风险的心理健康对话中的表现。与以往可能向计算机提出关于危机的单一直接问题的测试不同,这个新的基准测试模拟了长期的、不断演变的对话,其中风险可能会缓慢显现、伴随其他问题出现,或随着时间的推移改变严重程度。研究人员根据真实生活经验构建了一个包含 200 个详细场景的库,涵盖了自杀、自残、家庭暴力和物质滥用,并让 125 个不同版本的 AI 模型对这些情况进行交谈。为了确保结果值得信赖,他们聘请了一组受过训练的心理健康专业人员来为对话评分,从而创造了一个关于安全且有帮助的回应的标准模板(金标准)。随后,他们使用了一个强大的、固定不变的 AI 模型版本来学习这些人类评分,从而能够快速且一致地评估更多模型的性能。
结果揭示了一个既充满希望又参差不齐的能力图景。表现最好的模型在安全性和临床判断方面的得分超过了 100 分中的 95 分,表明它们能够将共情倾听与必要的危险评估步骤结合起来。这些顶尖系统能够识别用户何时处于危机之中,在不具有冒犯性的情况下探索其情况的细节,并即使在风险复杂或并发的情况下也能建议适当的后续步骤。然而,研究也发现并非所有模型都同样出色。虽然许多系统非常擅长提供支持性的言语,但相当一部分模型在关键的任务——风险探索上却表现挣扎。有些模型未能提出正确的问题来了解情况的严重程度,而另一些模型则完全忽略了危险,在用户实际上需要紧急帮助时仅提供了安慰。研究人员发现,仅仅让模型“思考得更努力”或给它更多处理时间并不会自动使其变得更安全;事实上,对于某些模型来说,更改设置反而使其表现变差。
研究还考察了给予 AI 特定的指令让其扮演治疗师的角色是否会提高其安全性。研究结果显示,这种方法对某些较弱的模型效果很好,显著提升了它们的安全性得分,但对最强的模型几乎没有影响,甚至产生了负面影响。这表明不存在一种能修复所有系统安全问题的单一“神奇提示词”;相反,对话的安全性取决于模型、设置及其指令的具体组合。研究人员还发现,随着对话变得更加复杂(即多个风险同时出现或升级为即时危险),许多模型的表现略有下降,这凸显出即使是最好的系统在面对最困难的临床情况时也会感到吃力。
或许最重要的一点是,研究人员设计这个基准测试是为了使其随着时间的推移保持有用性。他们将用于测试的具体问题和场景进行了保密,以防止开发者通过简单地记忆答案来操纵系统。这确保了用于对模型进行排名(排行榜)的机制仍然是一个公平且独立的现实世界安全性衡量标准。研究结论指出,虽然当前的技术已经取得了显著进展,领先的模型现在已经能够进行安全且具有临床连贯性的对话,但仍有大量工作要做。最安全的路径是将这些工具用于情感支持和初步信息收集,同时确保在识别出危机时存在一条明确的人类介入路径。该基准测试提供了一种追踪这一进展的方法,能够识别哪些模型正在真正改进,以及哪些配置在被信任处理最脆弱的对话之前还需要更多改进。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。