← 最新论文
💻 computer science

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

RAPTOR+ 是一种以视觉为根基的视觉 - 语言框架,它用微调后的多模态模型取代了传统的基于光学字符识别的流程,从而显著提高了紧急结直肠癌转诊中的提取准确性和证据定位能力,进而增强了临床信任度与可审计性。

原作者: Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Benjamin Wallace, William Poulett, Adam Byfield, Lukman Akanbi, Muhammad Bilal

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Benjamin Wallace, William Poulett, Adam Byfield, Lukman Akanbi, Muhammad Bilal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文**RAPTOR+**的解释。

问题: “盲目”的读者

想象一位忙碌的医院接待员,必须处理数百份疑似癌症的紧急转诊单。这些表格杂乱无章:有些是打印的,有些是手写的,有些被印章覆盖,还有些传真质量很差。

旧系统(称为RAPTOR)试图通过两个独立的步骤来自动化这一过程:

  1. 扫描仪:它首先拍摄表格的照片,尝试将手写内容转换为数字文本(就像一台试图阅读你手写的复印机)。
  2. 阅读器:然后将该数字文本交给一个智能 AI,以提取重要答案(例如“患者的年龄是多少?”或“症状是什么?”)。

缺陷:这个系统就像一个被要求忽略图片的人读书。如果字迹潦草或布局怪异,“扫描仪”就会出错。更糟糕的是,即使“阅读器”给出了正确答案,它也无法指出是在原始纸张的哪个位置找到该答案的。这就像学生在考试中给出了正确答案,却拒绝展示解题过程。医生无法信任它,因为他们无法核实证据。

解决方案:“超级观察者”(RAPTOR+)

作者创建了RAPTOR+,这是一个新系统,像一个超级观察者一样运作。这个新 AI 不再将阅读与观察分离,而是同时查看整个文档图像。

这就像一位侦探,他不仅阅读线索,还能用激光笔指向证据板上线索的确切来源位置。

工作原理

  • 它看到整张图片(杂乱的表格)。
  • 它阅读文本。
  • 它理解布局(方框的位置)。
  • 关键的是:当它给出答案时,它会在图像上找到该信息的精确位置周围画出一个方框。

实验:测试侦探们

研究人员在223 份真实且杂乱的癌症转诊单上测试了这个新系统。他们比较了三种类型的“侦探”:

  1. 大型商业模型:功能强大的 AI 工具(如 Gemini 和 Claude),仅被要求执行任务,未经过任何特殊训练(零样本)。
  2. 开源模型:免费的 AI 工具(如 Qwen),不同尺寸,同样被要求执行任务而未经过训练。
  3. 经过训练的模型:相同的开源工具,但首先通过带有正确答案和正确方框的表格示例接受了“速成课程”(微调)。

结果:阅读与指向

研究发现,阅读(获得正确答案)与指向(展示答案来源)之间存在巨大差距。

  • “自信但错误”的问题
    大型商业模型在阅读方面表现出色。例如,Gemini92.6%的时间给出了正确答案。然而,当被要求指出证据时,它几乎毫无用处。它成功指向正确位置的比例仅为1.2%

    • 类比:想象一个学生算出了正确的数学答案,却在页面上圈错了数字。这看起来像是他们做了功课,但实际上并没有。
  • “沉默”的问题
    一些较小的开源模型对指向如此不确定,以至于它们根本没有任何方框。

  • 获胜者:经过训练的侦探
    当他们让Qwen3-VL-8B模型接受那个特殊的“速成课程”(微调)后,结果发生了巨大变化。

    • 阅读准确率:它有**96.1%**的时间给出了正确答案(甚至比之前更好)。
    • 指向准确率:它有**60.6%**的时间成功指向了正确位置。
    • 类比:这就像一个学生不仅给出了正确答案,还高亮了教科书中证明该答案的确切句子。

为什么这很重要:信任与安全

该论文认为,在医院中,信任比单纯的速度更重要。

  • 旧方法:如果 AI 说“患者有症状 X",医生必须手动检查整张杂乱的纸张以确认其真伪。这违背了自动化的初衷。
  • 新方法(RAPTOR+):如果 AI 说“患者有症状 X"并高亮了确切的手写内容,医生只需瞥一眼高亮部分,就能说“是的,这是正确的”,然后继续工作。

主要结论

该论文得出结论,对于医疗文档,不能仅仅使用擅长阅读的智能 AI。你必须专门训练它,使其理解需要展示其工作过程。

  • 微调(特殊训练)将一个“擅长阅读但在指向方面盲目”的模型,转变为一个“两者皆优”的模型。
  • 这使得系统可审计。医生可以信任机器,因为机器能够证明其信息的来源。

简而言之:RAPTOR+ 是一个不仅给你答案,还向你展示作业的系统,使其足够安全,可供医生在现实生活中使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →