← 最新论文
📄 psychiatry and clinical psychology

Clinically Grounded AI-Scribing in Psychotherapy: Benchmarking LLMs Against Expert Documentation in the iCARE Framework

本文介绍了具有临床依据的 iCARE 文档框架及相应的 iHOPE 数据集,用于对十一个大语言模型进行基准测试,结果表明,尽管闭源模型在自动化指标方面通常优于开源模型,但人类专家的评估凸显了特定的优势与不足——例如在时间推理方面的困难以及临床偏好的差异——这些发现强调了开发旨在辅助而非取代治疗师的 AI 工具的必要性。

原作者: Adhikary, P. K., Singh, S., Singh, S., Sharma, P., Soni, P., Choudhary, R., Saxena, C., Chauhan, P., Gupta, S. K., Deb, K. S., Singh, S. M., Chakraborty, T.

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Adhikary, P. K., Singh, S., Singh, S., Sharma, P., Soni, P., Choudhary, R., Saxena, C., Chauhan, P., Gupta, S. K., Deb, K. S., Singh, S. M., Chakraborty, T.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在进行心理治疗的静谧房间里,这项工作是极其人性化的。它依赖于治疗师倾听来访者的故事,察觉停顿中的重量,并理解一个延伸至数年前的恐惧背后的语境。为了有效地开展这项工作,治疗师还必须保留记录。这些笔记不仅仅是行政性的文书工作;它们是一个人内心世界的地图,捕捉了从眼前的危机到塑造其人格的家庭背景与生活习惯的一切细节。传统上,撰写这些笔记一直是一项沉重的负担,将临床医生的注意力从患者身上拉开,转向了电脑屏幕。近年来,人工智能承诺要减轻这一负担。这些“AI 书记员”可以倾听对话并将其转录出来,但在复杂的心理健康领域,目前大多数系统都显得力不从心。它们往往只能产生简短、枯燥的摘要,忽略了定义一次治疗环节的细微差别、情感底色以及关键的安全细节。挑战在于如何构建一台不仅能转录文字,而且能理解故事的机器。

来自印度和新加坡的研究团队通过重新思考治疗笔记应如何构建以及机器应如何学习写作,在解决这一问题上迈出了重要一步。他们首先创建了一个名为 iCARE 的全新且全面的文档框架。不同于许多医院使用的旨在进行快速行政检查的缩略格式,iCARE 旨在捕捉临床诊疗的全方位深度。这是一个包含十七个不同部分的详细结构,范围从基本的身份信息、来访者的主要诉求,到对其病史的深入挖掘,再到针对自残等即时危险的风险评估,以及对未来诊疗计划的规划。研究人员认为,AI 系统必须首先具备生成这种丰富、完整的图景的能力,然后才能将其浓缩为更短的摘要。为了测试这一想法,他们构建了一个名为 iHOPE 的新数据集。他们从一个公开资源库中提取了 174 段录制的治疗过程,清理了音频以确保每一句话都被听清,随后由一组专家级的精神科医生和心理学家根据新的 iCARE 格式为每段对话撰写了完美的“金标准”笔记。这创造了一个基准,即一套用于衡量任何机器水平的理想答案。

随后,研究人员对十一个不同的语言大模型进行了测试。这些模型——即现代 AI 聊天机器人背后的强大计算机程序——被要求倾听治疗录音并撰写 iCARE 笔记。他们通过两种方式测试模型:第一,在不提供任何示例的情况下给予录音;第二,在要求它们撰写其余部分之前,先展示一个完美的笔记示例。结果显示,不同类型的 AI 之间存在明显的鸿沟。闭源模型(由大型科技公司开发且不对公众开放修改)的表现始终优于开源模型(由公共社区构建)。其中一个特定的模型 GPT-4o-mini 在衡量机器词汇与人类专家词汇匹配程度的标准计算机测试中获得了最高分。另一个模型 Gemini Pro 则在识别危机标记(如自杀风险或物质滥用迹象)方面表现出特别的优势,而这些正是治疗中至关重要的安全细节。

然而,当研究人员要求人类专家而非依靠计算机算法来评判笔记时,故事变得更有趣了。他们邀请了六位心理健康专业人员进行盲审,在不知道笔记由哪种 AI 撰写的情况下,根据五个关键品质进行评分:可信度、相关性、准确性、完整性和清晰度。人类专家发现,尽管顶尖的商业模型表现出色,但它们在处理时间流向方面仍然存在困难。机器经常无法正确区分哪些是过去诊疗中发生的事,哪些是为下次诊疗所做的计划,而理解时间线是治疗中的基本要素。令人惊讶的是,人类专家更倾向于使用一个名为 Mistral 的较小的开源模型,而非那些功能更强大的商业模型。事实上,Mistral 是唯一一个在某一特定类别中得分略高于人类撰写笔记的模型:完整性。这一发现表明,我们目前衡量 AI 成功与否的计算机算法并不总是符合人类临床医生实际的需求。商业模型擅长匹配特定短语,但小型模型在专家眼中似乎能更有效地捕捉到诊疗过程中的临床本质。

研究结论指出,虽然人工智能已经准备好协助治疗师,但尚未准备好取代他们。研究人员发现,最好的路径是协作式的,即由 AI 处理起草详细笔记的繁重工作,从而让治疗师能够进行审查、完善并最终定稿。这种方法可以为临床医生腾出宝贵的时间,让他们专注于患者而非键盘。团队强调,他们的工作不是最终方案,而是一个基础。他们已将新的框架、专家笔记数据集以及评估方法向其他科学家开放,以便该领域能够持续进步。最终目标是弥合心理健康护理巨大需求与可用治疗师数量有限之间的差距,利用技术来支持而非替代那份处于治愈核心的人文连接。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →