PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
本文介绍了 PathAgentBench,这是一个利用 1,822 幅全切片图像和专家标注的综合基准测试,旨在评估视觉语言模型在病理学中寻找证据的能力,研究表明,尽管模型擅长对已有的证据进行推理,但在直接从十亿级像素图像中自主获取并定位诊断区域方面仍面临显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正在试图解开一个隐藏在巨大城市里的宏大谜团,这个城市比一颗沙粒还要大上数十亿倍。这座城市是一个“全切片图像”(WSI)——即一张组织样本的数字照片,其规模巨大,人类仅通过滚动查看就需要耗费数小时。在现实世界中,病理学家(通过观察细胞来诊断疾病的医生)并不会只盯着一个微小的点看。他们会先从直升机上俯瞰整座城市,寻找可疑的街区,然后放大观察街道,最后再进一步放大,去检查每一栋房屋和每一个人,从而找出罪魁祸首。这被称为“证据搜寻”。
最近,科学家们构建了超级聪明的计算机大脑,称为“视觉语言模型”(VLMs)。它们就像是 AI 侦探,既能看图,又能读懂文字。它们在处理一些特定任务时表现得非常出色,比如当有人递给它们一张特定的照片并问道:“这里出了什么问题?”时。但现在有一个大疑问:这些 AI 侦探能否在没有人类指引的情况下,自己在这座巨大的城市里找到那张正确的照片?如果一个 AI 能解开谜题,却找不到藏着谜题的房间,那么它还称不上是一个优秀的侦探。这正是这项新研究想要衡量的差距。
AI 侦探大测试:PathAgentBench
研究团队构建了一个全新的、极具挑战性的测试,名为 PathAgentBench,旨在测试 AI 是否真的能像人类病理学家一样工作。大多数旧有的测试只是给 AI 一张预选好的图片并问它:“这是什么?”(这是它们的常规做法),而这次他们把整座巨大的城市交给了 AI,并要求它自己去搜寻线索。
你可以把它想象成一场“寻找威利”(Where's Waldo)的游戏,只不过这本书的大小相当于一个足球场,而且你必须通过不断地放大和缩小来寻找那些证明坏人身份的微小细节。研究人员创建了一个“诊断树”,它就像是一张寻宝图。AI 从顶端(整个切片)开始,挑选一个可疑区域,放大,挑选一个更小的区域,再次放大,最后根据它沿途收集到的所有线索做出诊断。
为了确保测试公平且具有难度,他们使用了来自一个庞大数据库的 1,822 张真实医学切片,并让 十名 资深人类医生绘制出他们解决病例时会采取的确切路径。随后,他们测试了 20 种不同的 AI 模型(包括由大型科技公司开发的、开源的以及专门针对医学领域的模型),以观察它们的表现。
以下是他们的发现,其中包含了一些意想不到的转折:
1. AI 是天才读者,却是糟糕的导航员
当研究人员把 AI 需要的具体线索交给它时(例如:“这是可疑细胞的放大图,现在告诉我是什么”),AI 的表现非常惊人。最优秀的模型正确率超过了 93%。它们能完美地解读证据。
然而,当研究人员说:“好了,现在你要自己在巨大的城市里找到那个可疑细胞”时,AI 彻底崩溃了。即使是最聪明的 AI 模型,其空间重叠得分(称为“平均交并比”,mean intersection-over-union)也低于 0.09。这意味着 AI 在可疑区域周围画出的框,几乎没有触及到真实的地点。事实上,一个非常简单、甚至有些笨拙的技巧——仅仅猜测前一个框的中心点——效果竟然比那些花哨的 AI 模型还要好!
2. “缩放”难题
研究人员观察了 AI 在自主探索切片时的过程。在最宽的视野下(低倍率),AI 大约有 52% 的概率能找到可疑区域。但当它试图放大以获取更近距离的观察时,它开始迷失方向。到了最高放大倍率(即需要看到微小细节时),它找到正确位置的概率仅为 2%。这就像是一个侦探找到了正确的街区,却在错误的巷子里迷了路,永远找不到目标房屋。
3. 专业化 AI 并不总是更好
你可能会认为,专门针对医学书籍训练的 AI 模型会是最好的侦探。令人惊讶的是,那些通用的 AI 模型(经过猫、车等各种事物训练的模型)在寻找线索方面往往比仅针对医学训练的模型表现得更好。那些专业的医学模型有时会卡住,或者甚至无法输出坐标来指向某个位置。
4. 搜寻的成本
这项研究还观察了搜寻过程消耗了多少“脑力”和金钱。AI 必须寻找线索的部分(“自主探索”)极其昂贵且缓慢。AI 仅仅观察一张切片就需要花费数分钟,而回答一个关于预选图片的简单问题只需不到一秒钟。
核心结论
本文的核心观点是:虽然 AI 在被递给证据进行“解读”方面已经变得非常出色,但在自主“寻找”证据方面仍然非常糟糕。研究人员认为,我们不应仅仅庆祝 AI 能够解开谜题,我们还需要教会它如何成为一名能够真正找到谜题本身的侦探。
在 AI 能够可靠地在这些巨大的数字切片中进行导航之前,它无法在现实世界中完全取代人类病理学家。论文指出,未来的 AI 需要学习更好的“空间推理能力”(知道自己在哪里)、学会如何正确使用缩放工具,以及如何在走错路时进行自我恢复。目前来看,AI 是一个卓越的读者,但它仍在学习如何行走于街头。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。