← 最新论文
💬 NLP

Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines

本文提出了一种方法,通过从官方临床指南生成合成数据并应用强化学习持续预训练,将一款 140 亿参数的语言大模型适配至巴西医疗领域,所得模型在 newly 建立的巴西临床基准测试中表现优于规模更大的专有系统。

原作者: Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo, Rodrigo Nogueira

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo, Rodrigo Nogueira

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,巴西的公共医疗体系(SUS)是一座庞大且细节极其丰富的图书馆,其中藏有 178 本巨型规则手册。这些手册明确告知医生如何诊断疾病、开具何种药物以及向超过 2 亿公民提供多少剂量。问题在于?这些规则手册是用葡萄牙语写成的,而且厚得惊人、复杂无比,即便是人类医生也无法记住每一个细节。

目前,人们用来回答医学问题的“超级智能”人工智能计算机(大语言模型,LLMs)就像只学过英语教科书的学生。它们懂很多医学知识,但从未读过巴西的规则手册。如果你向它们提出一个关于巴西剂量的具体问题,它们往往会猜测,或者答错。

本文讲述的是如何教导其中一名人工智能学生,使其成为巴西规则手册的大师。以下是他们如何做到的,分解为简单步骤:

1. “翻译”难题

研究人员无法直接将原始 PDF 规则手册喂给人工智能。这就像试图通过递给某人一本他们几乎不懂的语言写成的 500 页手册来教他们开车。人工智能需要将这些信息“烹饪”成它能消化的格式。

因此,他们建立了一个合成数据厨房

  • 食材:他们取用了 178 本官方规则手册(约 540 万词)。
  • 厨师:他们聘请了四位不同的“人工智能厨师”(不同的大语言模型)。
  • 食谱:他们并非简单复制文本,而是让这四位厨师以三种不同的风格重写规则手册:
    1. 改写者:用不同的措辞重写规则,但保留原意。
    2. 维基百科撰稿人:将枯燥的法律文本转化为易于阅读的百科全书文章。
    3. 问答大师:基于规则创建问题及详细答案。

通过使用四位不同的厨师,他们创造了一个包含约 7000 万词“重新构想”的巴西医学知识的庞大图书馆。这就像将一本教科书用四种不同的声音重写,以确保学生理解每一个角度。

2. 训练营

他们选取了一个标准的人工智能模型(Qwen2.5-14B),并让它经历了一个两步走的训练营:

  • 第一步:阅读图书馆(持续预训练):人工智能阅读了全部 7000 万字的合成数据。它不仅仅是在死记硬背,而是在学习巴西医学的“氛围”和具体事实。
  • 第二步:教官(强化学习):阅读之后,他们并没有就此止步。他们让人工智能参加一个训练,要求它回答关于规则的是非题。如果它答对了并解释了原因,它就会获得奖励;如果它只是猜测,则一无所获。这迫使人工智能停止猜测,开始像医生一样进行推理。

3. 期末考试

为了验证训练是否有效,研究人员创建了两项其他人工智能从未参加过的特殊测试:

  • “是非题”测试(HealthBench-BR):人工智能必须识别医学规则中的细微差别(例如:“这种药物是通过静脉还是动脉给药?”)。
  • “开放式问题”测试(PCDT-QA):人工智能必须用自己的语言回答复杂的医学问题,随后由另一名人工智能裁判进行评分。

结果:小模型击败巨头

结果令人惊讶。研究人员开发的模型相对较小(140 亿参数),但在这些特定的巴西测试中,其得分超过了全球最大、最昂贵的人工智能模型(如 GPT-5.2、Claude 和 Gemini)。

  • 得分:它在是非题测试中获得了约**84%的分数,在开放式问题中获得了85%**的分数。
  • 对比:即使是谷歌基于搜索的人工智能(实时在网上查找答案),其得分也低于这个经过训练的模型。
  • “阿谀奉承”的修正:一个有趣但重要的发现是,在最终训练步骤之前,人工智能倾向于即使用户错了也同意用户(像个“应声虫”)。“教官”训练教会了它在证据不匹配时说“不,那实际上是错的”。

为何这很重要(根据论文所述)

论文声称,这是一份蓝图,展示了如何在不需要数百万美元或秘密数据的情况下,教导人工智能了解特定的非英语医疗体系。他们证明了:

  1. 多样性是关键:使用四位不同的人工智能“厨师”来重写数据,比仅使用一位要好得多。
  2. 奖励有效:“教官”步骤对于获得高分至关重要。
  3. 开源:他们免费发布了所有数据、测试以及最终的人工智能模型,以便其他研究人员可以利用它们来帮助讲葡萄牙语的医生。

重要提示:作者非常明确,这是一个研究工具,而非经过认证的医疗设备。它旨在支持医生,而非取代他们。它就像一个熟读了所有巴西规则手册的非常聪明的医学生,但仍需要持证医生做出最终决定。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →