← 最新论文
💰 quantitative finance

How much does context affect the accuracy of AI health advice?

该研究指出,大型语言模型在健康声明验证中的准确性高度依赖于语言、主题和信息来源,其在英语及权威语境下的优异表现无法可靠泛化至其他多语言或复杂现实场景,因此在部署前亟需进行多语言、特定领域的评估。

原作者: Prashant Garg, Thiemo Fetzer

发布于 2026-02-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Prashant Garg, Thiemo Fetzer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给一群“超级聪明的 AI 健康顾问”做一场全方位的“体检”和“压力测试”

想象一下,你生病了,想问一个无所不知的机器人医生:“这个药能治我的病吗?”或者“喝这个真的能排毒吗?”

这篇研究的核心发现就是:这个机器人医生虽然很聪明,但它的能力严重依赖于“你在哪”、“问什么”以及“它读过什么书”。 如果它只懂英语,或者只读过某些特定的书,它在其他情况下可能会给你“一本正经的胡说八道”。

下面我用几个生动的比喻来拆解这篇论文:

1. 两个不同的“考场”

研究者给 7 个最流行的 AI 模型(比如 GPT-4, Gemini 等)出了两套题:

  • 第一套题:官方标准答案(“教科书”)

    • 内容:来自英国和欧盟官方注册的 1975 条经过法律批准的“营养与健康声明”。比如“钙有助于骨骼健康”。
    • 比喻:这就像是在做公务员考试,题目是固定的,答案也是官方盖章的。
    • 结果:AI 在英语和欧洲语言(像法语、德语)里考得非常好,几乎满分。但是,一旦换成波斯语、印地语、中文或土耳其语,分数就开始断崖式下跌
    • 原因:AI 的“大脑”主要是用英语和欧洲语言训练的。就像一个人只精通英语,突然让他用斯瓦希里语做数学题,他虽然能猜,但容易出错。语言离英语越远,AI 就越容易“晕头转向”。
  • 第二套题:现实世界的“谣言与新闻”(“街头巷尾”)

    • 内容:来自 9000 多条真实的公共卫生新闻,包括关于新冠、堕胎、政治和一般健康的各种说法。来源有政府网站、科学期刊、福克斯新闻、甚至 YouTube。
    • 比喻:这就像是在嘈杂的菜市场里做判断。这里没有标准答案,充满了情绪化、简化的口号,或者复杂的科学摘要。
    • 结果:AI 在这里的表现差了很多,而且表现非常不稳定。
      • 考得好的时候:当题目是“关于新冠的政府公告”或“福克斯新闻的短新闻”时,AI 很准。因为这些内容在它的训练数据里像“刷屏”一样多,而且句式简单(比如“疾控中心说……")。
      • 考得差的时候:当题目是“复杂的科学期刊摘要”或“一般健康建议”时,AI 就懵了。科学文章通常充满了“可能”、“也许”、“在某种条件下”等复杂的限定词,AI 很难抓住重点,容易把“可能有效”误判为“绝对有效”。

2. 为什么 AI 会“偏科”?(三个关键因素)

研究者发现,AI 犯错不是因为题目太难,而是因为它的“成长环境”有问题:

  • 因素一:训练数据的“偏食”
    • 比喻:AI 就像个挑食的孩子。它吃了很多互联网上的新闻(像快餐),所以很擅长理解新闻标题。但它很少吃到“付费墙”后面的科学期刊(像营养均衡的蔬菜),所以看不懂复杂的科学论文。
  • 因素二:表达方式的“套路”
    • 比喻:新闻喜欢说“ CDC 说这是真的”,这种直球AI 很容易懂。但科学论文喜欢说“在特定条件下,数据显示可能有相关性”,这种绕弯子的“学术黑话”让 AI 经常误判。
  • 因素三:话题的“特殊照顾”
    • 比喻:因为新冠疫情期间谣言满天飞,开发者给 AI 做了很多专项特训(微调),所以它在新冠话题上表现好。但对于“堕胎”或“一般健康”这些没有特别特训的话题,它就恢复了“普通水平”,甚至更差。

3. 最大的警示:别把“英语成绩”当“全科成绩”

论文最核心的结论是:不要以为 AI 在英语里考 90 分,它在中文、印地语或阿拉伯语里也能考 90 分。

  • 现状:目前 95% 的 AI 医疗研究都是用英语做的。这就像只测试了汽车在平地上的表现,就以为它在泥地、雪地或沙漠里也能跑得一样快。
  • 风险:如果我们在全球范围内直接部署这些 AI 来提供健康建议,可能会加剧信息不平等。英语使用者能得到准确的建议,而使用其他语言的人可能会收到错误信息,甚至被误导去尝试危险的“偏方”。

4. 未来的路该怎么走?

研究者建议,在把 AI 医生真正派上用场之前,必须做三件事:

  1. 分语言、分场景测试:不能只看英语成绩。要在具体的语言(如中文、西班牙语)和具体的场景(如疫苗安全、传染病爆发)下单独测试。
  2. 像“实习医生”一样监管:在全面推广前,先在小范围(比如医院咨询台或政府问答网站)试运行,并且必须有人类医生在旁监督,防止 AI 胡说八道。
  3. 把“公平”写进法律:像欧盟的《人工智能法案》那样,要求 AI 公司必须公开它们的数据来源,确保不同语言的人都能获得同样质量的健康建议,而不是让 AI 成为“英语特权”的工具。

总结

这篇论文告诉我们:AI 健康顾问目前还像个“偏科的天才学生”。它在英语、简单新闻和特定话题上表现优异,但在其他语言、复杂科学和冷门话题上容易“翻车”。

在真正把它当作我们的健康顾问之前,我们需要先帮它“补补课”,确保它不会因为语言或话题的不同,而给出一本正经的“健康误导”。毕竟,在健康问题上,“差不多”的准确率,可能就是生与死的距离。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →