← 最新论文
💻 computer science

Towards Selection of Large Multimodal Models as Engines for Burned-in Protected Health Information Detection in Medical Images

本文对三个大型多模态模型(GPT-4o、Gemini 2.5 Flash 和 Qwen 2.5 7B)在医疗图像中检测受保护健康信息方面进行了基准测试,发现尽管它们在文本提取方面优于传统光学字符识别,但其整体检测精度的提升在复杂印迹模式上最为显著,而非清晰可读的文本,据此提出了针对性的选型建议与可扩展的部署策略。

原作者: Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一叠旧的医疗 X 光片或扫描图像。这些图像中隐藏着小小的“印章”或“水印”(如日期、患者姓名或 ID 号码),它们直接“烧录”在图片上。如果你希望将这些图像用于研究或教学,就必须先擦除这些印章以保护患者隐私。这被称为查找并移除PHI(受保护的健康信息)。

长期以来,医生和技术团队使用一种两步机器人流程来完成这项工作:

  1. 扫描器:一种专用工具(称为 OCR),它查看图像并尝试像非常快速的打字员一样读取文本。
  2. 编辑器:一个智能计算机程序,它读取打字员写下的内容并做出判断:“这是秘密的患者姓名吗?是的,删除它。这只是医院的日期吗?不,保留它。”

新想法:“超级阅读器”

这篇论文的作者提出了一个问题:如果我们用“超级阅读器”替换“编辑器”会怎样?

这些超级阅读器是大型多模态模型(LMMs)——你可以把它们想象成极其聪明的 AI 助手(如 GPT-4o、Gemini 或 Qwen),它们能够同时查看图片、理解上下文并读取文本。它们就像一位人类专家,能够查看一张模糊的便条并说:“啊,上面写着‘约翰·多伊’,那肯定是一个患者姓名。”

研究人员测试了三种不同的超级阅读器,看看它们是否能比旧的“扫描器 + 编辑器”团队做得更好。他们设置了两种不同的测试运行方式:

  • 设置 A(传统团队):使用旧的、快速的“扫描器”读取文本,然后将该文本发送给超级阅读器,由其决定删除哪些内容。
  • 设置 B(一体化团队):将原始图像裁剪部分直接发送给超级阅读器,并要求它同时完成“读取”和“决定”两项任务。

他们的发现(结果)

1. 超级阅读器擅长阅读(有时)
当图像上的文本杂乱、模糊或难以辨认时,超级阅读器(尤其是那些庞大而强大的模型)在读取文本方面比旧扫描器表现更好。这就像人类通常比标准打字机更能辨认潦草的手写便条一样。

2. 但聪明并不总是意味着更快
这里有个陷阱:超级阅读器既庞大又缓慢。

  • 速度陷阱:当超级阅读器尝试同时完成“读取”和“决定”(设置 B)时,处理速度显著变慢——有时比传统团队慢 30% 到 70%。
  • “足够好”的现实:在文本原本清晰易读的图像上,超级阅读器在发现秘密方面实际上并没有比旧扫描器做得更好。事实上,对于某些数据集,传统团队反而更准确,因为超级阅读器会被过多的文本搞糊涂,或在阅读中出现小错误。

3. “金发姑娘”模型
研究人员测试了三种特定的超级阅读器:

  • GPT-4o:“重量级冠军”。它在发现秘密方面最准确,但同时也是运行最慢、成本最高的。这就像聘请一位世界级侦探,他需要很长时间才能破案。
  • Gemini 2.5 Flash:“速度之星”。它的表现几乎与冠军相当,但速度快得多且成本更低。这就像一位非常敏锐的侦探,工作迅速。
  • Qwen2.5-VL 7B:“开源本地派”。这个模型可以在你自己的计算机上免费运行(这对隐私很有好处)。它表现不错,但有时会在复杂情况下感到困惑,例如区分患者 ID 和研究 ID。

主要结论

论文总结道,你不应该盲目地将旧系统替换为超级阅读器。这取决于你的具体情况:

  • 如果你拥有杂乱、难以阅读的图像:超级阅读器值得等待,因为它能看到旧扫描器遗漏的内容。
  • 如果你拥有清晰、易读的图像:旧的、快速的扫描器通常同样有效,而且速度快得多。
  • 如果你需要保持数据隐私:你可能希望使用“本地派”(Qwen),即你可以在自己的服务器上运行的模型,即使它稍不完美,因为你无需将患者数据发送到云端。

简而言之:新的 AI 工具功能强大,但它们并非能瞬间解决一切问题的魔法按钮。有时,旧的、简单的工具实际上是最佳选择,而最佳解决方案往往是两者的结合,具体取决于图像的杂乱程度以及你获取结果的速度需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →