Automatic detection of depression in clinical interviews with large language models
本研究表明,利用基于 Transformer 的模型和集成策略对临床访谈进行自动化语言分析,可以有效地检测粤语使用者的大型抑郁症,在显著提高处理效率的同时,也凸显了转录质量和对话语境对于实现最佳性能的重要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
抑郁症是一种普遍且严重的疾病,影响着全球数百万人,然而,能否及早发现往往取决于一个人能否接触到受过训练的精神健康专业人员。在许多地方,这些专家非常匮乏,诊断过程可能十分缓慢,导致许多人无法及时获得所需的帮助。为了解决这一问题,研究人员开始探索计算机是否可以通过聆听人们的说话方式来学习识别抑郁症的迹象。这一领域依赖于这样一个理念:一个人描述感受的方式、他们选择的词汇以及对话的节奏,都能揭示其心理状态。人工智能的最新进展创造了强大的工具,能够理解人类语言,为自动分析这些对话提供了一种新途径。其目标并非取代医生,而是创建一个快速、便捷的工具,帮助识别谁需要护理,从而有可能触及那些原本无法被诊断出的患者。
香港中文大学的一个研究小组致力于测试这些人工智能工具是否能通过临床访谈录音准确检测出重度抑郁障碍。他们与299名粤语参与者合作,其中包括194名被诊断为抑郁症的患者和105名健康个体。研究人员记录了结构化访谈,由一名临床医生提问,参与者进行回答。为了观察能否使这一过程更快速、更具扩展性,他们比较了将这些音频录音转化为文本的两种方法。第一种方法是传统方法,即由人工手动记录下所说的每一个字,这一过程对于每次访谈大约需要45分钟。第二种方法使用自动化系统即时转录音频。随后,他们将这些文本输入到几种不同的旨在理解语言的计算机模型中,测试这些模型是否能够区分健康参与者和抑郁症患者。
研究发现,使用自动化转录系统在效率上实现了巨大的飞跃。它将处理每次访谈所需的时间从大约45分钟缩减到了不到10分钟,减少了79%。这种速度使得快速分析大量的访谈成为可能,这对于实际应用至关重要。然而,研究人员也发现,这种速度伴随着微小的权衡。基于人工编写文本训练的模型在识别抑郁症方面比基于自动生成文本训练的模型略好一些。这表明,尽管机器在“聆听”方面已经变得非常出色,但它们偶尔仍会错过人类转录员能捕捉到的细微差别。尽管存在这一微小的差距,自动版本仍然非常有效,证明了该技术已准备好用于对速度要求极高的实际应用场景。
另一个关键发现是关于计算机应该聆听对话的哪些部分。研究人员测试了两种情景:一种是模型仅阅读患者的回答,另一种是模型阅读整个对话,包括医生的提问。他们发现,当模型拥有完整对话语境时,表现会更好。患者简短的回答,例如“并不真的”或“有时”,如果单独来看可能显得模糊,但当模型看到之前的提问时,其含义就会变得清晰得多。例如,如果医生询问睡眠模式,而患者回答“有时”,计算机就会理解这是指睡眠障碍。这种语境有助于模型做出更准确的判断,表明医生与患者之间的互动蕴含着宝贵的线索,如果仅分析患者的声音,这些线索就会丢失。
为了使这种检测更加可靠,团队将几种不同计算机模型的预测结果结合成了一个更强大的单一系统。他们测试了合并这些意见的各种方式,例如取其评分的平均值,或寻找其中的最强信号。这种被称为“集成”的组合方法,提高了检测的准确性,超越了任何单一模型所能达到的水平。这种表现最好的组合随后在一个包含169名此前并未参与过本研究的年轻人的全新群体上进行了测试。在这次独立测试中,组合系统以极高的准确度成功识别了抑郁症,其表现与表现最好的单一模型相当,并略优于其他模型。这证实了该系统可以将其发现推广到新的人群,而不仅仅是参与训练的人群。
这项研究的结果为心理健康护理提供了一条充满希望的路径。研究人员证明,构建一个能够高精度地从语音中检测抑郁症的系统是可行的,同时能大幅缩减分析所需的时间。尽管自动转录文本并不完美,但它们足以支持一个在现实世界中运作良好的系统。研究还强调,将医生的提问纳入分析可以提供至关重要的语境,从而提高计算机的理解能力。虽然该系统尚未成为人类诊断的替代品,但它代表了向使心理健康筛查更快速、更便捷、并让更多需要的人能够获得服务迈出的重要一步。这项工作表明,通过正确的工具,技术可以帮助弥合抑郁症患者与他们应得的护理之间的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。