← 最新论文
💬 NLP

PathReportEval: A Systematic Benchmark for Pathology Report Generation

本文介绍了 PathReportEval,这是一个用于病理报告生成的标准化基准和评估框架,它通过采用一种基于临床基础的临床报告质量评分(CRQS)来解决现有词法指标的局限性,从而准确评估不同模型和数据集在事实正确性、幻觉以及临床不一致性方面的表现。

原作者: Suryakant Singh, Sejuti Majumder, Beatrice Knudsen, Joel Saltz, Prateek Prasanna

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Suryakant Singh, Sejuti Majumder, Beatrice Knudsen, Joel Saltz, Prateek Prasanna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:计算机可以观察人类组织的显微切片,并撰写医生的诊断报告。这是“计算病理学”的最前沿领域——在这个领域中,人工智能试图将吉像素级的细胞图像转化为复杂且能挽救生命的医学诊断语言。为了实现这一点,计算机需要精通两件事:一是看清图像中的微小细节(例如发现可疑的细胞簇),二是针对所见之物写出一个清晰、准确的故事。但棘手之处在于:我们如何知道计算机是否真的做得很好?如果一台计算机写出的报告听起来很高级,并且使用了正确的医学术语,这是否意味着它是正确的?或者,它是否可能在自信满满地犯错,漏掉癌症诊断,或者凭空捏造一个并不存在的问题?这就是科学家们正在努力解决的大问题:我们如何衡量一个“机器人医生”是在讲述真相,而不仅仅是在模仿医生的口吻?

PathReportEval 出现了解答这一难题,它是一项旨在为这些人工智能系统充当严格、公正“裁判”的新研究。研究人员意识到,目前评判这些计算机生成报告的方法是有缺陷的。目前,大多数科学家使用标准的“语言游戏”(如 BLEU 和 ROUGE 等指标),这些指标仅仅是计算计算机生成的报告与人类报告之间有多少重合的词汇。这就像是在评价一名学生的作文时,只根据他们使用了多少个老师最喜欢的词汇来打分,而不去检查学生是否真的理解了数学题。论文指出,这种方法是危险的,因为计算机可以通过模仿报告的风格来获得高分,却完全忽略了关键的医学事实。

为了解决这个问题,团队构建了一个大规模的标准化测试场。他们选取了四种不同的 AI“学生”,并使用三种不同的“眼睛”(视觉编码器)来观察图像,在三组不同的真实医疗数据上对它们进行了测试。但真正的明星是他们开发的新型评分系统——临床报告质量得分(CRQS)。CRQS 不仅仅是统计匹配的词汇,它更像是一位资深病理学家,通过阅读报告并核对一份特定的清单来进行评估:AI 是否提到了诊断结果?它对肿瘤分级是否判断正确?它是否捏造了虚假的癌症(即“幻觉”)?或者它是否与事实相矛盾?

研究结果令人大开眼界。研究发现,旧有的“词汇计数”方法经常会对那些在医学上极其危险或完全错误的报告给出高分。例如,某个 AI 可能会因为写出了一份与真实报告非常相似的报告而获得高分,即便它不小心将“高等级”癌症改成了“低等级”——这种错误可能会危及患者的生命。相比之下,新的 CRQS 系统能立即捕捉到这些错误,它会给错误的报告打低分,而给那些即便措辞不同但事实正确的报告打高分。论文指出,要在这个领域取得真正的进展,我们需要停止仅仅关注文本看起来多么“华丽”,而应开始衡量其临床准确性。通过提供这个全新的、公平的基准测试和公开的测试工具包,作者希望能够帮助构建出让医生真正信任、并能协助挽救生命的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →