← 最新论文
💻 computer science

Automated Disease Prediction and Prescription System with Regional Kannada Synonym Integration

本文提出了一种自动化的疾病预测与处方系统,该系统利用 RNN-LSTM 模型将区域性的卡纳达语医学同义词准确地翻译成英语,从而在上下文识别方面超越了 Google Translate 和 Whisper 等现有工具,以协助医疗专业人员管理高患者量。

原作者: Giridhara Gouda, Suma R

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Giridhara Gouda, Suma R

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:集成区域性卡纳达语同义词的自动化疾病预测与处方系统

问题陈述
有效的医疗服务高度依赖于提供者与患者之间的清晰沟通。在多语言地区,语言障碍经常导致误诊、用药错误以及患者预后不佳。虽然神经机器翻译(NMT)已取得显著进展,但现有的解决方案(如 Google Translate 和 Whisper)在处理低资源语言时,尤其是在处理区域方言和医学同义词方面,往往无法实现准确翻译。在印度的卡纳塔克邦(Karnataka),患者经常使用不同的区域性卡纳达语术语(同义词)来描述同一种疾病,而标准的翻译工具会误解或进行字面翻译(例如,将表示“瘙痒”的区域术语翻译为“早餐”或“刺激”)。此外,缺乏针对这些特定语言对的公共大规模医学数据集,限制了鲁棒且具备领域适应性翻译模型的发展。

方法论
作者提出了一种集成了语音转文本转换、区域同义词感知机器翻译以及疾病预测的自动化系统。其核心技术流程包括:

  1. 数据收集与预处理: 创建了一个包含约 900 个卡纳达语-英语句子对的定制数据集,重点关注患者症状和疾病描述。数据经过清洗(转为小写、去除特殊字符)、分词和词汇表构建。
  2. 模型架构: 系统采用循环神经网络(RNN)架构,具体利用**长短期记忆网络(LSTM)**单元来处理序列数据和长期依赖关系。
    • 编码器-解码器框架: 编码器将输入的卡纳达语文本处理为固定维度的向量(隐藏状态和细胞状态),而解码器则生成英语翻译。
    • 注意力机制: 模型集成了通用注意力和全局注意力机制,使解码器能够动态地关注源句子的相关部分,从而缓解标准编码器-解码器模型的由于信息瓶颈带来的问题。
    • 训练策略: 在训练期间使用**教师强制(Teacher Forcing)**算法,通过提供精确的参考输出给解码器,以提高收敛速度。
    • 解码: 对贪婪解码(Greedy Decoding)和束搜索(Beam Search)方法进行了评估,以优化翻译的流畅度和准确性。
  3. 同义词集成: 该方法的一个关键组成部分是系统识别区域性卡纳达语疾病同义词的能力。不同于可能在方言变体上失效的标准翻译工具,该模型经过训练,能够将这些区域性变体映射到正确的英语医学术 最近术语。
  4. 处方预测: 一旦文本被翻译且疾病被识别,系统会查询数据集以预测相应的药物。

主要贡献

  • 区域同义词处理: 开发了一种专门用于处理卡纳达语-英语对的翻译模型,重点关注区域医学同义词,填补了 Google Translate 等工具经常失效的空白。
  • 架构实现: 在 RNN-LSTM 框架内集成了注意力机制和教师强制算法,以增强针对低资源语言的翻译质量。
  • 对比评估: 将提出的模型与 Google Translator 和 Whisper 翻译器进行了全面比较,证明了其在特定医学语境下的卓越性能。
  • 数据集创建: 创建了一个包含约 900 个患者症状句子的专门数据集,以促进该领域的训练和评估。

结果
该系统使用标准 NMT 指标进行了评估:BLEU、METEOR 和翻译编辑率(TER)。

  • 翻译准确度: 提出的模型实现了 41.5–31.8 的 BLEU 分值范围和 52.2% 的 METEOR 分值,优于 Google Translator(BLEU 35.8–28.4,METEOR 39.5%)和 Whisper Translator(BLEU 39.8–30.8,METEOR 41.5%)。
  • 误差减少: 该模型的翻译编辑率(TER)为 53.1%,低于 Google 的 69.2% 和 Whisper 的 64.6%。
  • 同义词识别: 在定性测试中,提出的模型正确识别了疾病的区域性术语,如“瘙痒”(正确翻译了各种区域性卡纳达语术语)、“哮喘”和“静脉曲张”,而 Google 和 Whisper 则产生了字面或错误的翻译(例如,将表示瘙痒的区域术语翻译为“早餐”)。
  • 处方预测: 系统在基于翻译后的疾病描述预测药物方面报告了 95% 的准确率,尽管这是针对特定数据集背景下的预测误差进行的评估。

意义与声明
论文声称,该系统通过准确翻译标准工具容易忽略的区域方言和同义词,成功弥合了卡纳达语人群在医疗沟通中的鸿沟。通过使机器人或自动化系统能够理解患者的自然语言输入并预测合适的药物,该系统旨在协助医疗专业人员更高效地管理高患者量。作者强调,虽然该系统显示出良好的前景,但其设计目的是支持而非取代医疗专业人员;所有预测的处方均旨在由人类专家进行验证以确保安全,同时也承认了 AI 在保证无缝准确性方面存在的局限性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →