← 最新论文
📄 other

StrokeID-NER : A Stroke Named Entity Recognition Dataset for Indonesian Patient- Generated Health Queries

本文介绍了 StrokeID-NER,这是一个公开可用的印尼语数据集,包含 1,742 条针对中风相关命名实体进行标注的患者生成健康查询,该数据集用于证明经过微调的 Transformer 模型在识别非正式和地区性医学术语方面显著优于零样本基准模型,同时强调未来的性能提升主要取决于扩大词汇覆盖范围,而非模型架构。

原作者: Miseri Cordiaz S, Yaseen Muhammad, Md Ariful Islam Mozumder, Hee Cheol Kim

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Miseri Cordiaz S, Yaseen Muhammad, Md Ariful Islam Mozumder, Hee Cheol Kim

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:StrokeID-NER

问题陈述
中风是印度尼西亚死亡和残疾的主要原因,然而,临床自然语言处理(NLP)工具在进行中风分诊时,受限于缺乏针对患者生成文本的特定领域标注资源。虽然像 Alodokter.com 这样的数字健康平台托管了大量的非正式印尼语健康查询,但这些文本带来了独特的 NLP 挑战:极端的拼写变体、地域方言(如爪哇语)的使用、通俗隐喻、代码混用(code-mixing)以及具有文化特性的时间引用(例如伊斯兰历事件)。现有的印尼语医学命名实体识别(NER)数据集要么侧重于正式的临床记录,要么侧重于健康新闻或医患混合对话,未能解决非正式、仅限患者的针对性中风查询中所特有的语言学和临床复杂性。

研究方法
本研究引入了 StrokeID-NER,这是一个通过四个阶段构建的专门化命名实体识别(NER)数据集和基准测试框架:

  1. 数据构建: 该数据集包含从“Indonesia-medical-qna”数据集(源自 Alodokok.com)中筛选出的 1,742 条患者查询,专门针对中风和出血性中风主题。研究排除了医生回复,以模拟仅依赖患者输入的真实世界分诊情况。
  2. 标注方案: 查询使用 BIO(Begin-Inside-Outside)方案进行标注,涵盖四个临床基础实体类型的九个标签:
    • 症状 (SYM): 身体/神经系统表现(例如:lemas, drodog)。
    • 诊断 (DGN): 中风亚型和病症(例如:stroke ringan, pendarahan otak)。
    • 时间 (TMP): 发作、持续时间和时间点(例如:tiba-tiba, saat hari ke-20 puasa)。
    • 风险因素 (RF): 既往病史和人口统计学特征(例如:hipertensi, usia 65 tahun)。
    • 标注者间一致性 通过分层样本进行评估,得出 Cohen's Kappa 系数 κ=0.857\kappa = 0.857
  3. 数据集统计: 该语料库包含 6,765 个实体跨度(span)。一个显著特征是高 hapax 率(仅出现一次的独特表达),范围从诊断类(DGN)的 72.0% 到风险因素类(RF)的 86.9%,反映了文本的非正式性和多样性。
  4. 基准测试: 在分层训练/验证/测试集(1,211/256/275 条查询)上评估了五种 NER 系统:
    • M1: IndoBERT-base + 线性头(Linear head)。
    • M2: IndoBERT-base + CRF 层。
    • M3: XLM-RoBERTa-large(多语言)+ 线性头。
    • M4: IndoBERT-large + 线性头。
    • 基准模型 (Baseline): 在零样本(zero-shot)设置下评估的 GPT-5.4。
    • 评估指标: 使用 seqeval 进行跨度级宏平均 F1 分数(span-level macro-averaged F1-score)评估。

关键结果

  • 模型性能: 微调后的 XLM-RoBERTa-large (M3) 表现最佳,宏 F1 分数为 0.7823。它分别比单语言 IndoBERT-large (M4, F1=0.7614) 和零样本 GPT-5.4 基准模型 (F1=0.6682) 高出 2.1 个和 11.4 个百分点。
  • 特定实体洞察:
    • 诊断 (DGN) 是最容易识别的实体(F1 0.86–0.89),归功于“stroke”及其变体的高频出现。
    • 症状 (SYM)风险因素 (RF) 最难识别,这与其高 hapax 率相关。
    • 零样本大语言模型(LLM)在 DGN 上表现尚可,但在 SYM 和 RF 上明显落后,无法捕捉非正式表达和地域术语。
  • 误差分析:
    • Hapax 约束: hapax 率与 F1 分数之间存在强负相关性。68.3% 的假阴性跨度被所有四种微调模型所遗漏,这表明性能瓶

    • 微调 vs. 零样本: 微调模型正确识别了 204 个零样本模型遗漏的跨度,而反向情况仅为 57 个(比例为 3.6:1)。这种优势在 SYM (4.6:1) 和 RF (7.0:1) 中最为显著。

    • 二分类 vs. 联合训练: 为特定实体训练二分类器提高了 DGN 和 TMP 的性能,但使 RF 的性能下降了 0.08 F1 点,这表明跨实体上下文对于识别风险因素至关重要。

意义与主张
本文提出了四个主要贡献:

  1. 首个公开语料库: 发布了第一个针对印尼语、特别是针对非正式患者生成文本的、具有临床基础的中风 NER 公开语料库。
  2. 基准测试见解: 证明了对于低资源语言的非正式临床 NER,多语言预训练(XLM-RoBERTa)比增加单语言模型规模(IndoBERT-large)能带来更大的性能提升,尤其是在处理具有高词汇多样性的实体时。
  3. 语言学分析: 文档化了印尼语中风查询独特的语言现象,包括拼写变体、爪哇语口语以及具有文化特性的时间表达,而标准的 NLP 资源无法捕捉这些现象。
  4. 微调的必要性: 经验性地验证了在处理非正式语言和临床语境时,针对特定领域的微调显著优于大语言模型的零样本提示(zero-shot prompting)。

作者总结认为,未来的性能提升受限于词汇覆盖率而非模型架构。他们认为,通过额外的标注或数据增强来扩大训练词汇表,是比修改架构更有效的途径。该数据集、指南和模型均已公开发布,以支持进一步的研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →