← 最新论文
📄 public and global health

Benchmarking Speech Recognition Models for Medical Consultations in Latin American Spanish: A Comparative Evaluation with Fine-Tuning

这项研究对十种语音转文本模型在拉丁美洲西班牙语医学问诊中的表现进行了基准测试,发现虽然对 Whisper Large v3 进行微调并未超越其原始版本,但它在关键指标上优于其他开源和闭源模型,从而确立了其作为该背景下 AI 医学速记最佳开源解决方案的地位。

原作者: Carrillo, R. M., Carbajal Serrano, A., Condori Pinedo, P. S.

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Carrillo, R. M., Carbajal Serrano, A., Condori Pinedo, P. S.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下这样一个世界:当你说话时,你的医生不必打一个字。相反,一台智能计算机在倾听你的整个就诊过程,准确地记录下你所说的一切,并将其转化为一份整洁的医疗记录。这就是“AI医疗速记员”的梦想。但要实现这一目标,计算机需要在一项特定的任务上表现得极其出色:倾听人类的语音并将其转化为文本。这项工作被称为“语音转文本”(STT)。你可能通过手机的语音助手了解过它,但那些助手通常是针对清晰、标准的英语进行训练的。然而,现实世界是混乱的。人们说话带有不同的口音,使用俚语,互相抢话,并且会使用复杂的医学术语。在拉丁美洲,西班牙语有着极其丰富的地域特色和方言,要让计算机理解医生和患者的对话,就像是在试图教一只鹦鹉在从未听过的语言中背诵诗歌,而这只鹦鹉还坐在一个嘈杂拥挤的市场里。如果计算机把词弄错了,医疗记录就会出错,这可能是危险的。因此,科学家们需要弄清楚哪些计算机在处理这项棘手任务时真正表现出色,然后才能让它们进入真实的诊所。

这篇论文就像是一场大规模、高风险的“味觉测试”,旨在测试十个不同的“倾听大脑”(AI模型),看哪一个最擅长理解拉丁美洲西班牙语的医疗对话。研究人员收集了来自该地区不同国家的医生与患者交谈的十段真实视频。他们聘请了一名人类来准确记录每段视频中所说的内容,从而创建了一个“金标准”答案库。然后,他们将这十段视频的音频输入到十个不同的AI模型中——其中五个是免费且开源的,任何人都可以使用;另外五个是来自大型科技公司的付费闭源工具。他们根据每个AI的转录内容与人类完美版本之间的接近程度对每个AI进行了评分,评估范围涵盖了从简单的单词错误到语义是否得到保留的所有方面。

但研究人员并不仅仅停留在测试阶段;他们还想看看能否通过针对医学数据进行专门的“教学”,让其中一个表现最好的开源模型变得更强。他们选择了表现最好的开源竞争者,名为 Whisper Large v3,并利用其中的九段视频对它进行了“强化课程”。他们将音频切成微小的10秒片段,让模型反复练习,尝试不同的教学方法,以观察它是否能学会拉丁美洲医生特有的俚语和医学术语。他们甚至尝试了“数据增强”,这就像是一位老师通过添加背景噪音、改变声音音调或同时播放两段对话,让学生在更艰苦的环境下学习,从而学会忽略干扰。

故事在这里变得有趣起来。研究人员发现,付费的闭源模型通常是更强大的倾听者,其中一个名为 Gemini-2.5-pro 的模型在整体表现上脱颖而出。然而,在免费的开源模型中,Whisper Large v3 是明显的赢家。当他们尝试通过“微调”来让这个模型变得更好时,却遇到了一个令人惊讶的障碍。他们原以为增加所有这些额外的“噪音”和练习(数据增强)会让模型变得更聪明,就像一个在混乱图书馆里学习的学生一样。相反,这反而让模型变差了。额外的噪音让模型感到困惑,事实上,当他们只是让它学习那些干净、清晰的录音而不添加额外的混乱时,它的表现反而更好。

在最后的决战中,他们将这个“经过训练”的模型放在它从未见过的第十段视频上进行了测试。即使经过了专门训练,这个微调后的模型也没有击败顶尖的付费模型。事实上,在处理这段未见的单段视频时,与那些大型商业工具相比,它的排名仅为六个中的第四。然而,它在特定领域展现出了一些潜力,例如理解句子的整体含义,在“语义相似度”方面的得分高于其他一些模型。论文表明,虽然微调 Whisper Large v3 是为拉丁美洲打造免费医疗速记员的一种可靠策略,但它并不是一个能瞬间击败昂贵的企业巨头的“万灵药”。研究人员得出结论,虽然微调后的开源模型是一个强大的基准,但我们仍需要更多的数据和更好的训练,才能真正掌握拉丁美洲医疗语音那多样且复杂的复杂世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →