← 最新论文
💻 computer science

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

本文提出了一种名为 EndoASR 的领域自适应语音识别系统,通过两阶段适应策略显著提升了胃肠道内镜手术中的转录准确率与医学术语识别能力,并在多中心真实临床环境中验证了其高效、稳健的人机协作性能。

原作者: Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何让 AI 听懂医生在肠胃镜检查时说的话”**的故事。

想象一下,肠胃镜检查(Endoscopy)就像是一场**“体内探险”。医生手里拿着像长蛇一样的镜子,在病人的肠道里穿梭,寻找息肉、溃疡或肿瘤。在这个过程中,医生双手都被占用了(一手拿镜子,一手操作工具),他们只能靠嘴巴**来描述看到的景象,比如:“这里有个红色的息肉,形状像草莓,位置在乙状结肠……"

1. 遇到的难题:AI 是个“门外汉”

以前,医生如果想让 AI 帮忙记录或分析,就得对着电脑说话。但普通的语音识别软件(比如 Siri 或微信语音输入)就像是一个刚学中文的小学生,它虽然能听懂日常对话,但面对医生说的专业术语(比如“巴黎 IIa 型”、“波士顿肠道准备评分”)和嘈杂的背景音(机器轰鸣声、抽吸声),就会听得云里雾里,甚至胡编乱造

这就好比让一个只读过童话书的翻译官,去翻译一本全是生僻字的《高等医学词典》,结果肯定是灾难性的。

2. 解决方案:EndoASR —— 给 AI 穿上“专科制服”

为了解决这个问题,研究团队开发了一个叫 EndoASR 的系统。他们给这个 AI 设计了一套**“特训计划”**,分两步走:

  • 第一步:背诵“专业词典”(语言适应)
    因为医生在检查时说话的专业录音很难收集(涉及隐私),研究团队想出了一个绝招:“无中生有”。他们把成千上万份标准的肠胃镜报告(文字版)喂给 AI,然后用文字转语音(TTS)技术,把这些文字变成了“假”的医生说话录音。

    • 比喻: 就像让 AI 先读透了所有的医学教科书,并模仿医生的语气把书里的内容“背”下来,让它熟悉那些生僻的医学术语。
  • 第二步:在“噪音工厂”里练听力(抗噪适应)
    肠胃镜室里很吵,有机器声、水流声。研究团队收集了真实的噪音,把这些噪音加到刚才的“假”录音里,让 AI 在嘈杂的环境中继续练习。

    • 比喻: 就像让 AI 戴着耳机,在装修电钻声和菜市场叫卖声中,依然能精准地听清医生说的每一个字。

3. 实战演练:从“单中心”到“全国巡演”

训练好后,他们进行了两场大考:

  • 第一场(回顾性考试): 用过去某一家医院 6 位医生的真实录音来测试。

    • 结果: 普通 AI 的错误率高达 20% 以上(每说 5 个字就错 1 个),而 EndoASR 把错误率降到了 14% 左右,而且医学术语的准确率从 54% 飙升到了 87%。这就像是一个学生从“及格”直接变成了“优等生”。
  • 第二场(多中心大考): 这是最关键的。他们在5 家不同的医院进行了实地测试。每家医院的设备不同、环境不同、医生的口音和说话习惯也不同。

    • 结果: EndoASR 依然表现稳定,没有“水土不服”。它证明了这套系统不仅能听懂一家医院的话,还能适应全国不同医院的“方言”和“噪音”。

4. 为什么这很重要?(不仅仅是听写)

这个系统不仅仅是把声音变成文字,它还是**“人机协作”的关键接口**。

  • 速度极快: 它的反应速度极快(实时因子只有 0.005),医生说完话,屏幕上几乎瞬间就显示出文字。这就像给医生装了一个**“即时翻译官”**,不需要等待。
  • 辅助决策: 因为听得更准,后面的大语言模型(LLM)就能更准确地提取关键信息(比如:“发现息肉”、“位置:乙状结肠”),自动生成结构化的报告,甚至提醒医生注意风险。
    • 比喻: 如果听错了,AI 可能会把“切除息肉”听成“切除心脏”,后果不堪设想。EndoASR 确保了医生和 AI 是在同一个频道上对话。

总结

这篇论文的核心成就就是:造出了一个专门懂肠胃镜、抗噪音、反应快、且能在不同医院通用的“超级听写员”。

它不再是一个冷冰冰的算法,而是真正融入了医生的工作流程,让医生可以**“动口不动手”**,专注于治病救人,而把繁琐的记录工作交给可靠的 AI 伙伴。这是医疗 AI 从“实验室玩具”走向“临床神器”的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →