Brazilian-PHI: Benchmarking Checksum-Validated Recognizers for CPF, CRM, CNS, CNPJ, RG, CEP, and Phone in Portuguese Clinical Text
本文介绍了 Brazilian-PHI,这是首个用于检测临床文本中七种巴西个人健康信息的基准测试,证明了带有校验和验证的自定义 Presidio 识别器在准确性、延迟以及对 LGPD 合规性要求方面,显著优于默认工具和大语言模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字医疗时代,患者的病历不仅仅是疾病与康复的故事;它是一幅由个人细节织就的密集织锦,必须受到法律的保护。在巴西,一项被称为《通用数据保护法》的特定法规将健康信息视为一种特别敏感的类别,要求任何处理这些笔记的计算机系统必须首先剥离任何可能识别特定个人的信息。这个被称为“去标识化”的过程,是允许人工智能从医疗数据中学习而不侵犯隐私的守门人。然而,这项任务远非易事。巴西的医疗笔记包含了一套独特的身份识别代码——包括税务记录、医疗执照、健康卡和商业注册的号码——这些代码遵循严格且复杂的格式。与简单的姓名或地址不同,许多此类代码都包含数学校验,就像安全封条一样,用以证明该号码是真实的,而非随机的数字字符串。如果计算机系统遗漏了这些代码,或者将一个无害的数字误认为私密代码,其后果可能非常严重,其范围涵盖了巨额罚款到丧失患者信任。
一位名叫 Igor Eduardo 的研究人员致力于解决该领域的一个特定空白:目前还没有标准测试来衡量不同的计算机工具在医疗文本中查找这七种特定巴西身份识别代码的能力。虽然存在针对英语或西班牙语的工具,但面对巴西数据的独特结构时,它们往往会失效。为了进行测试,研究人员创建了一个包含 500 份虚假医疗笔记的大型集合。这些笔记经过精心设计,看起来非常真实,其中混杂着七种类型的身份识别代码,以及数百个看起来相似但并无危害的其他数字,例如药物剂量或医院设施代码。目标是观察哪种方法能够在不被那些无害数字干扰的情况下,准确找到真实的私密代码。该研究比较了三种不同的方法:一种标准的、开箱即用的软件工具;一种能够从海量文本中学习的强大人工智能模型;以及一个专门针对巴西格式进行训练并能执行数字数学校验的定制版软件。
结果揭示了不同技术在处理结构化数据方面的明显差异。定制软件经过编程,专门寻找巴西代码的特定形态并验证其数学封条,其表现近乎完美。它找到了测试笔记中所有七种识别类型的每一个实例,且未出错,正确地忽略了所有看似相似的无害数字。相比之下,标准的、未经修改的软件未能找到大部分这些代码,因为它根本不知道要寻找什么,成功率非常低。人工智能模型虽然在理解语言方面表现出色,但在处理这些数字的严格规则时却显得力不从心。它找到了大部分代码,但也犯了一些错误,将一些无害的设施代码误认为是私密识别号码。至关重要的是,人工智能无法执行证明号码有效的数学校验;它只能基于模式进行猜测,这就是为什么它偶尔会犯定制软件完全避免了的错误。
或许最令人震惊的发现不仅在于准确性,还在于速度。定制软件处理每份医疗笔记的时间不到十微秒,这个时间尺度短到几乎是瞬时的。然而,人工智能模型处理同一份笔记则需要超过八百毫秒。这意味着定制工具的速度大约比人工智能快八万倍。为了直观理解这种差异,如果人工智能是一个正在朗读一页纸的人,那么定制工具就像一台能在那个人读完一个句子的时间内,读完整个图书馆的机器。这种巨大的速度差异表明,对于从医疗记录中清除私密数字这一特定任务,依赖缓慢且昂贵的人工智能在规模化应用中是不切实际的。研究结论认为,最好的方法是采用混合模式:使用快速、基于规则的工具来捕捉严格的数学代码,并将强大的、灵活的人工智能留给寻找更复杂、非结构化细节(如姓名和地址)的任务。这种结合既提供了保护患者隐私所需的速度与可靠性,又同时允许先进技术改善医疗保健。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。