← 最新论文
💬 NLP

Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs

该研究通过 SemClinBr 语料库和乳腺癌数据集评估了多种 BERT 模型及大语言模型在葡萄牙语临床命名实体识别任务中的表现,发现 mmBERT-base 模型在结合迭代分层等类别平衡策略后取得了最佳效果(微 F1 分数为 0.76),证明了多语言 BERT 模型在资源受限环境下处理葡萄牙语临床文本的有效性。

原作者: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferrei
发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira, Oge Marques, Lucas Emanuel Silva e Oliveira

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在巴西的医疗系统里,给一群“智能助手”举办了一场“找茬”大赛

想象一下,医院的病历本上写满了医生和护士手写的、或者打字记录下来的文字。这些文字里藏着很多重要的信息,比如“病人对什么药过敏”、“肿瘤的大小”、“有没有转移”等等。但是,这些信息散落在成千上万页的像“天书”一样的文字里,人工去读、去整理,既慢又容易出错。

这篇论文的目的,就是看看现在的 AI 技术能不能像一位经验丰富的老医生一样,快速、准确地从这些杂乱的病历里,把关键信息(比如“乳腺癌”、“基因突变”)给“抓”出来

1. 参赛选手:谁在比谁?

比赛分成了两派选手:

  • 老牌学霸队(BERT 模型): 这些是专门为了“读书”而训练的 AI。它们就像是在图书馆里泡了很久的学生,有的专门读过医学书(BioBERT),有的读过葡萄牙语的所有书(BERTimbau),还有的读过全世界各种语言的书(mmBERT)。
  • 超级天才队(大语言模型 LLM): 比如 GPT-5 和 Gemini。它们就像那种“过目不忘”的天才,什么都能聊,什么都能答,但通常比较“贵”,而且反应慢,就像请了一位诺贝尔奖得主来帮你做简单的填空题,虽然可能做得好,但成本太高,而且有时候会“想太多”。

比赛场地(数据集):

  • 公开考场: 一个大家都能看到的、包含各种科室病历的公开数据库(SemClinBr)。
  • 秘密考场: 一个来自巴西南部一家私人癌症中心的、只有 500 份乳腺癌病历的“绝密”档案。这是为了测试 AI 在真实、私密环境下的表现。

2. 比赛中的大难题:偏科生(数据不平衡)

比赛中遇到了一个巨大的麻烦:有些信息太常见了,有些信息太罕见了。

  • 常见信息: 比如“发烧”、“疼痛”,病历里到处都是。
  • 罕见信息: 比如某种特定的基因突变,可能 1000 份病历里只有 2 份提到。

这就像让一个学生做数学题,如果 99% 的题目都是"1+1",只有 1% 的题目是“微积分”,那学生肯定只练"1+1",遇到微积分就懵了。在 AI 里,这叫**“类别不平衡”**。如果处理不好,AI 就会变成“偏科生”,只会抓常见的词,抓不到关键的罕见词。

3. 解题策略:怎么教 AI 不偏科?

研究团队尝试了三种“补习班”策略:

  1. 随机分班(Random Split): 就像把学生随机分到 A、B 班。结果发现,B 班可能刚好全是“微积分”题,A 班全是"1+1"题,导致训练效果不稳定。
  2. 精心分班(迭代分层 Stratification): 这是冠军策略!就像老师特意安排,确保每个班里既有"1+1"也有“微积分”,而且比例和总人数一样。这样 AI 在训练时,每时每刻都能接触到各种难度的题目,学得特别均衡。
  3. 题海战术(加权损失与过采样):
    • 加权: 告诉 AI:“如果你做错了那个罕见的‘微积分’题,我要扣你双倍分!”强迫它重视。
    • 过采样: 把那些罕见的题目复印很多份,塞进练习册里,让 AI 多练几次。

4. 比赛结果:谁赢了?

  • 冠军:mmBERT-base
    这位选手表现最惊艳!它就像是一个**“博闻强记且善于归纳的瑞士军刀”**。它既读过全世界的书(多语言训练),又懂得如何高效学习。

    • 它在公开考场上拿到了最高分(F1 分数 0.76),刷新了纪录。
    • 在秘密考场(乳腺癌病历)上,它也表现得很稳。
    • 最重要的是: 它不需要昂贵的超级计算机,普通的家用电脑(甚至带个不错的显卡)就能跑,而且完全在本地运行,不用担心病人隐私泄露
  • 关于“超级天才”(LLM):
    GPT-5 等模型虽然聪明,但在这个任务上:

    • 性价比低: 为了多拿几分,成本(钱)和时间(等待时间)增加了十几倍。
    • 隐私风险: 把病人的病历发给云端的大模型,就像把病历本寄给陌生人看,医院通常不敢这么做。
    • 表现: 即使开了“深度思考模式”,它们也没能打败那个专门训练的 mmBERT。

5. 核心启示(用大白话总结)

  1. 不要盲目追求“最强大脑”: 在医疗这种需要精准、快速且保护隐私的领域,一个专门训练过的、能在本地运行的“小模型”(如 mmBERT),往往比那些**昂贵、慢速、需要联网的“大模型”**更实用。
  2. “分班”很重要: 在教 AI 学习时,怎么把数据切分给 AI 练习(比如使用“迭代分层”),比用什么高级算法更重要。这就像老师怎么排座位,直接决定了学生能不能学好。
  3. 小数据也能办大事: 即使只有 500 份病历(对于 AI 来说很少),只要方法对(比如用对了分班策略),也能训练出一个非常靠谱的 AI 助手。

一句话总结:
这篇论文告诉我们,在葡萄牙语的医疗领域,不需要请“天价”的超级 AI,只要选对模型(mmBERT)并用对“分班”方法,就能用普通的电脑,低成本、安全地帮医生从病历里自动提取关键信息,让医疗工作更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →