← 最新论文
💬 NLP

How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

本文介绍了 BanglaMedVQA,这是首个经过临床验证的孟加拉语医学视觉问答数据集与基准,揭示出包括 Gemini 和 GPT-4.1 mini 在内的当前最先进基础模型,由于低资源语言固有的挑战及复杂医学推理的困难,在专业诊断任务上表现显著不佳。

原作者: Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一群非常聪明、博览群书的机器人(称为 AI 模型),它们擅长观察图片并回答相关问题。你已教会它们流利地说英语,甚至能相当准确地描述骨折或肿瘤的图像。

但如果你用孟加拉语(一种近 3 亿人口使用的语言)向它们提出同样的问题,会发生什么呢?这正是本文所研究的内容。

以下是他们发现的简要概述,分为几个简单部分:

1. 缺失的拼图

长期以来,科学家们一直在用英语测试这些 AI 机器人处理医学图像的能力。他们拥有大量高质量的英语测试集。但对于孟加拉语呢?几乎一无所有。虽然有一个旧的数据集,但它就像一块缺失了碎片、图像模糊的拼图——没人知道答案是否准确,甚至不确定是否有医生检查过。

本文的作者决定构建一个全新的、高质量的测试集,名为BanglaMedVQA

  • 素材:他们从两个著名且可靠的英文数据库中获取了数千张医学图像(如 X 光和 CT 扫描)。
  • 方法:他们利用先进的 AI 将医学问题和答案翻译成孟加拉语。
  • 质量控制:这是最关键的部分。他们并未仅依赖计算机。他们聘请了两位持证医生来检查每一个问题和答案。如果医生说“不,那是错的”,他们就进行修正。最终,该数据集达到了 97% 的准确率,并经过人工验证。

2. 大考:机器人有多聪明?

作者让顶尖的 AI 机器人(包括像谷歌 Gemini 和 OpenAI GPT 这样昂贵且闭源的模型,以及免费且开源的模型)接受了这项新的孟加拉语测试。

结果令人惊讶且有些令人担忧:

  • “通用”问题:当被问及一些简单的问题,例如“这是什么类型的图像?”(是 X 光还是 MRI?)或“这是身体的哪个部位?”(是肺还是大脑?)时,机器人的表现尚可。它们答对了约 40% 的问题。
  • “专科”问题:当问题变得更难时——例如,“这是什么具体疾病?”或“肿瘤在肺部的确切位置在哪里?”——机器人就崩溃了。
    • 即使是最好的机器人(Gemini 和 GPT)在这些难题上的表现也不如随机猜测。这就像它们只是向靶子投掷飞镖,希望能碰巧击中靶心。
    • 免费且开源的机器人表现更差,正确率往往低于 10%。

3. 语言障碍

研究人员还使用相同的问题用英语测试了这些机器人。

  • 差距:机器人在英语方面的表现明显优于孟加拉语。这就像一个学生在英语课上得了 A+,但当测试被翻译成他们几乎不懂的语言时,却不及格。
  • 结论:机器人在孟加拉语医学知识方面的训练不足。在这个语言中,它们是“低资源”学习者。

4. 我们能帮它们更好地思考吗?

研究人员尝试了一种称为“思维链”的技巧。他们不是立即让机器人给出答案,而是告诉它:“在回答之前,让我们一步步思考。”

  • 有效吗?是的,但只是一点点。它帮助机器人进行了一些推理,尤其是免费模型,但这并未解决核心问题。它们仍然难以准确定位疾病的具体位置或确定具体病症。
  • 瓶颈:论文指出,主要问题不仅仅是语言;而是机器人无法真正“看清”图像中的医学细节,以至于无法用孟加拉语解释它们。

5. 核心结论

本文是一个警钟。

  • 现状:我们已为孟加拉语医学 AI 构建了一个高质量、经医生验证的测试集。
  • 现实:即使是当今最先进的 AI 模型,也尚未准备好在孟加拉语环境中被信任用于复杂的医学诊断。它们擅长一般性地描述图像,但在诊断患者的关键任务上却失败了。
  • 未来:在我们能够将这些模型用于真实医院之前,我们需要构建更好的模型,并专门针对孟加拉语医学数据对它们进行训练。

简而言之:这些机器人就像医学生,他们背诵了英语教科书,但当被要求用孟加拉语诊断患者时,却在期末考试中不及格。我们创建了试卷(数据集)来证明这一点,而分数表明我们还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →