Consensus Measures for Unstructured Biomedical Text Annotations
本文研究了量化非结构化生物医学文本标注中评分者间信度的方法,并证明了尽管语义等价性度量(如嵌入和大型语言模型)具有各自的局限性,但自然语言推理为评估一致性提供了一种具有前景的折中方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正试图通过阅读数千封旧的手写信件来破解一个谜团。在医学世界里,科学家们也在做类似的事情:他们阅读数百万篇研究论文,以寻找关于疾病、药物和治疗方法的隐藏线索。但棘手的部分在于,有时他们寻找的线索并不列在清单中。相反,它们隐藏在自由流动的句子中,就像医生写下“患者感到精疲力竭且虚弱”,而不是勾选一个写着“疲劳”的选项框。
为了确保这些线索是真实的而非偶然现象,科学家通常会让两个或更多的人阅读相同的信件并记录下他们的发现。这被称为“标注”。如果两个人写下了完全相同的词汇,那么说他们达成了一致是很简单的。但如果一个人写的是“精疲力竭”,而另一个人写的是“累了”呢?它们是同一个意思吗?在过去,计算机可能会说“不,那是不同的词”,然后给出的协议得分就会很低。但在现实世界的医学领域,“精疲力竭”和“累了”表达的是同一个意思。这篇论文正是关于教计算机理解这种细微差别,以便我们可以信任我们在医学文献中发现的线索。
由 Pascal Wullschleger 及其团队领导的研究人员,致力于解决一个特定的难题:当人们是在写自由形式的笔记而不是从清单中进行选择时,我们该如何衡量两个人的意见一致程度?他们称之为“软性评分者间信度”(soft inter-rater reliability)。把它想象成批改一份创意写作作业。如果你要求两名老师给一篇论文评分,他们可能会使用不同的词汇来描述同一个优点。“硬性”评分系统会因为他们没有使用完全相同的词汇而判定他们失职。而“软性”系统则能理解“卓越的”和“优秀的”足够接近,可以算作达成一致。
该团队并没有仅仅靠猜测来解决问题;他们建立了一个巨大的数字游乐场来测试它。他们创建了数千个虚构的医疗场景,并在其中预先设定了“正确”答案。然后,他们让不同的计算机工具进行对决,看哪一个工具最擅长判断两个不同的描述是否表达了相同的含义。有些工具就像拼写检查器,计算有多少个字母不同(编辑距离)。另一些则像是智能词典,通过观察词汇的含义(嵌入向量)来工作。而最新的工具则像是巨大的、超级聪明的 AI 大脑(大语言模型),它们能够阅读一个句子并判断其意思是否与另一个句子相同。
以下是他们的发现,这有点像是一个剧情反转。那些“拼写检查器”工具在处理简单事物时表现尚可,但在遇到复杂的词汇时却惨败。那些“智能词典”工具速度很快,且擅长发现普遍的相似性,但它们有一个盲点:它们无法区分两个“相似”但“并不相同”的事物。例如,它们可能会认为“头痛”和“偏头痛”是同一种东西,因为这两个词看起来很像,尽管偏头痛是一种更具体、更剧烈的头痛类型。这在注重精准度的医学领域是一个大问题。
那些巨大的 AI 大脑在理解真实含义方面最为准确,但它们也有一个问题:运行如此大规模的测试来证明其有效性时,速度太慢且成本太高。这就像是拥有一位能完美破案的天才侦探,但完成案件需要一个月的时间,而你却需要在一秒钟内得到答案。
那么,谁是赢家呢?论文指出,最好的解决方案是一种基于“自然语言推理”(NLI)的中庸工具。把 NLI 想象成一个逻辑谜题求解器。它不只是计算字母或猜测相似度,而是询问:“如果这个句子是真的,那么那个句子是否也必然是真的?”这就像是在问:“如果我说‘我有一辆红色的车’,是否意味着‘我有一辆车’?”是的。但如果我说“我有一辆车”,是否意味着“我有一辆红色的车”?不一定。这种基于逻辑的方法在他们的测试中是最可靠的。它既足够快,可以投入实际应用,又足够聪明,能够避免其他工具犯下的错误。
研究人员还展示了这种方法不仅适用于单个单词,还适用于笔记列表。想象一位医生写下三个症状的列表,而另一位医生写下四个症状的列表。论文研究了如何完美地将它们匹配起来,就像从两个不同的堆中配对袜子,看看有多少是对齐的,即使这两个堆的大小并不相同。
最后,这篇论文并不声称已经解决了医学研究中的所有问题。它表明,对于目前而言,使用这些基于逻辑的 AI 工具是衡量自由文本医疗笔记一致性的最明智方法。这是向前迈出的一步,确保当我们挖掘医学文献这座大山以寻找新疗法时,我们不仅仅是在计数单词,而是在真正理解它们背后的含义。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。