PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark
本文介绍了 PersianMedQA,这是一个包含 20,785 道经专家验证的波斯语医学考试题的双语大型数据集,用于评估 41 个最先进的语言模型,并揭示尽管闭源通用模型的表现优于专门的波斯语模型,但原始语言中的文化与临床细微差别对于准确的医学推理仍然至关重要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一群学生如何成为医生,但你必须用两种不同的语言对他们进行测试:波斯语(他们的母语)和英语(大多数医学教科书的语言)。
这篇名为PersianMedQA的论文,就像一份来自伊朗的、拥有 14 年历史的庞大考试档案。它包含超过20,000 道多项选择题,涵盖从心脏手术到儿科的 23 个不同医学专科。作者利用这个“题库”来评估不同 AI“学生”(大型语言模型)在两种语言中回答医学问题的能力。
以下是他们发现的内容分解,使用了一些简单的类比:
1. “优等生”与“挣扎的本地人”
研究人员测试了 41 个不同的 AI 模型。
- “超级明星”(闭源模型): 表现最好的就像拥有最佳资源的精英私立学校学生。具体来说,GPT-4.1(一个闭源付费模型)答对了约**83%的波斯语问题和80%**的英语问题。它是当之无愧的赢家。
- “本地英雄”(波斯语模型): 作者惊讶地发现,专门为说波斯语而构建的模型(如Dorna)表现糟糕。它们的得分约为35%, barely 比猜答案好一点点。这就像一个从小讲这种语言的学生,却忘记了如何用这种语言阅读医学教科书。它们难以遵循指令,也无法通过推理解决问题。
- “专业学生”(医学模型): 专门在医学数据上训练的模型,表现也不如通用的“超级明星”。成为“医学 AI"并没有自动让它们更擅长回答波斯语的医学问题。
2. “翻译陷阱”
你可能会想:“如果 AI 在英语方面很聪明,只要把波斯语问题翻译成英语,它就能行。”
- 现实情况: 论文发现,虽然 AI 在英语中通常表现更好,但3% 到 10% 的问题只能在波斯语中正确回答。
- 类比: 想象一个食谱说:“加一撮藏红花。”如果你把它翻译成英语,它只是说“藏红花”。但在原始的波斯语语境中,这个食谱可能暗示一种在伊朗某个特定村庄种植、在当地更便宜且更常见的特定类型藏红花。如果你翻译了这个问题,你就失去了这种本地语境。
- 结果: 在某些情况下,AI 在波斯语中答对了,因为它理解了本地规则(例如在伊朗,什么年龄接种什么疫苗),但在英语中却答错了,因为翻译让它听起来像是西方的规则。
3. 更大并不总是更好
研究人员检查了让 AI“大脑”更大(更多参数)是否有帮助。
- 发现: 对于通用的“超级明星”模型,越大越好。但对于专门的医学或波斯语模型,仅仅让它们变大并没有帮助。这就像给学生一个更大的背包;如果里面没有合适的书,更大的包并不会让他们更聪明。他们需要的是正确的数据,而不仅仅是更多的数据。
4. “作弊”测试
为了看看 AI 是否真的在思考,还是仅仅根据模式在猜测,研究人员尝试了一个技巧:他们只向 AI 展示答案选项,而不展示问题。
- 结果: 在“医学伦理”部分,AI 仅通过查看答案就获得了惊人的高分。它学会了包含“患者自主权”或“同意”等词汇的答案通常是正确的。这就像一个没有学习课程的学生,却知道如果答案听起来非常礼貌和正式,那很可能就是正确答案。这表明这些测试可能高估了 AI 对伦理的实际理解程度。
5. “团队合作”实验
由于没有单个模型是完美的,研究人员尝试让排名前 3 或 5 的模型一起投票决定答案(像陪审团一样)。
- 结果: 这种“团队”方法帮助开源模型略微提高了分数,但仍然无法赶上单个“超级明星”模型(GPT-4.1)。
结论
该论文得出结论:你不能简单地将医学考试从英语翻译成其他语言,就指望 AI 能很好地工作。
- 医学知识与当地文化、法律和习惯(如疫苗接种时间表)紧密相连。
- 当前的 AI 模型,即使是那些经过波斯语训练的模型,在回答该语言的高风险医学问题时,还不足以可靠到值得信任。
- 我们需要为低资源语言构建更好的、具有文化意识的 AI,而不仅仅是翻译英语模型。
作者的重要提示: 论文明确指出,这些模型尚未准备好作为真正的医生使用。它们目前仅在接受考试题目的测试,在没有严格人类监督的情况下,不应部署在真实的医院中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。