ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation
该论文介绍了 ReXrank,这是一个公开的排行榜和标准化评估框架,其特点是拥有大规模的 ReXGradient 数据集以及多种用于客观评估和比较自动化胸部 X 光报告生成 AI 模型的指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:计算机可以观察一张模糊的黑白肋骨照片,并立即写出一份关于病情诊断的医生报告。这并非魔法,而是人工智能(AI)应用于医学——具体说是放射学领域的一个分支。多年来,科学家们一直在教计算机如何“阅读”X光片,但一直存在一个巨大的问题:每个人都在用不同的规则进行游戏。有些团队在其中一组照片上测试他们的AI,而另一些人在另一组照片上测试,并且他们使用不同的方式来评估AI写作水平的高低。这就像有一千所不同的学校在用不同的标准答案来批改数学作业——你根本无法判断谁才是真正的优等生。这篇论文步入了那个混乱的教室,旨在建立一个单一、公平且庞大的计分板,让每一个AI都能在相同的条件下接受测试。
这篇论文介绍了 ReXrank,这是一个公开的排行榜,旨在成为撰写胸部X光报告AI的终极裁判。把它想象成一场高规格的烹饪比赛,只不过参赛者不是厨师,而是计算机模型;评判的对象也不是舒芙蕾,而是评判一个机器人描述其所见医学图像的能力有多出色。作者收集了一个庞大的、秘密的“测试厨房”,名为 ReXGradient,其中包含来自美国67家不同医院的10,000份真实胸部X光研究病例。这是没有任何AI见过的“期末考试”。他们还加入了另外三个公开数据集,以确保这些模型不仅仅是在死记硬背答案,而是在真正地学习如何“烹饪”。
为了给这些机器人评分,研究人员没有只用一把尺子,而是使用了八把不同的尺子。有些尺子检查词汇听起来是否像人类写的(比如检查句子是否流畅),而另一些则是专门的医学尺子,用于检查AI是否正确识别了特定疾病,或者是否在患者并未骨折的情况下误报了骨折。他们甚至使用了一把“临床错误”尺子,它扮演着严厉编辑的角色,统计AI犯了多少个真实医生会发现的错误。
当尘埃落定后,结果非常清晰。一个名为 MedVersa 的模型脱颖而出,成为了冠军,它在几乎所有的测试中都表现出色,尤其是在极具挑战性的秘密数据集 ReXGradient 上。它甚至击败了像 GPT-4V 这样著名的通用型 AI 模型,后者虽然擅长许多事情,但未必是专门针对医学报告进行训练的。论文指出,在混合不同数据源上训练的模型往往更具鲁棒性,而其他模型在面对与其熟悉的数据风格不同的数据时则显得力不从心。有趣的是,研究发现一些公开数据集过于简单,就像是一场未能为实战做好准备的练习测试,而私有的 ReXGradient 数据集才是真正的压力测试,它揭示了哪些模型真正做好了进入医院的准备。
作者谨慎地指出,虽然 MedVersa 目前是表现最好的模型,但这并不是一个“已解决”的问题。医学是复杂的,论文强调,这些模型仍在被评估其对于新的、未见情况的泛化能力。ReXrank 的目标不是宣布一个永久的获胜者,而是提供一种标准化的方式供科学界追踪进展,从而确保当 AI 工具最终开始辅助医生时,它们是可靠、准确且对全球患者安全的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。