← 最新论文
💻 computer science

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

本文介绍了 MedicalNarratives,这是一个包含 470 万个医学图文对的大规模数据集,这些数据源自带有局部鼠标轨迹以进行时空定位的 YouTube 教学视频,该数据集被用于训练 GenMedClip 模型,而该模型在 12 个医学领域中均达到了最先进的性能。

原作者: Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教机器人如何理解医学图像,比如 X 光片或 MRI 扫描图。问题在于,机器人是“数据饥渴型”的。它们需要数百万个示例才能学习,但与猫或汽车的照片不同,可用的带标签医学图片并不充足。通常,为了让机器人理解图像的特定部分,人类必须费力地在周围画一个框,或者用鼠标描绘一条线。为数百万张图像进行这样的操作既缓慢、昂贵又枯燥。

本文介绍了一种名为 MEDICALNARRATIVES 的巧妙解决方案。以下是它的工作原理,将其分解为简单的概念:

1. “指着说话”的小技巧

想想老师是如何解释白板上的图表的。他们不仅仅是在说话,还会用手指指向他们正在描述的具体部分。“看这里,这处骨折,”他们说着,同时手指悬停在断裂处上方。

研究人员意识到,YouTube 上的医学专家也在做完全相同的事情。他们录制教学视频,在谈论患者扫描图的同时,移动电脑鼠标光标到他们正在讨论的具体区域。

该团队并没有雇佣成千上 thousands 个人来手动为每张图像画框,而是前往 YouTube 并采集了这些视频。他们将鼠标光标移动视为一个“数字手指”。当老师说“看到这个肿瘤了吗?”且鼠标悬停在其上方时,计算机就会记录下这种关联。

2. 构建医学“故事书”

团队构建了一个包含 470 万对图像和文本的海量库(数据集)。

  • 文本: 他们使用人工智能来聆听视频,转录医生所说的话,并清理医学术语。
  • 图像: 他们抓取了医生正在观看的具体帧。
  • “轨迹”: 他们精确记录了医生说出特定词汇时,鼠标光标所处的位置。

其中约有 100 万对包含这些“鼠标轨迹”,它们就像一张地图,准确显示了文本正在讨论图像的哪个部分。这就像拥有一本书,当你读到“红色的车”时,不仅是阅读文字,还有一个荧光笔物理性地指向图片中的那辆红车。

3. “机器人学生”(GENMEDCLIP)

为了测试这种方法是否真的有效,研究人员训练了一个名为 GENMEDCLIP 的新 AI 模型。你可以将这个模型看作一名医学生。

  • 训练: 他们向这名学生喂入了这 470 万个“指着说话”的示例。
  • 测试: 他们给学生进行了一系列涵盖 12 个不同领域(从心脏扫描到皮肤状况)的医学考试(基准测试)。

结果: 在这些“指着说话”的视频上训练过的学生,表现优于之前所有的顶尖模型。在给定描述的情况下,它在识别疾病和寻找正确图像方面的表现更为出色。论文指出,加入视频数据(指点轨迹)使得该模型比仅使用文本和静态图像的模型要聪明得多。

4. 为什么这很重要(根据论文)

论文声称这种方法解决了主要的瓶颈问题:落地(Grounding)。

  • 旧方法: 机器人看到一张图片并读到一个句子,但它不知道句子指的是图片的哪一部分。这就像是在不知道每种原料是什么的情况下阅读食谱。
  • 新方法: 因为鼠标轨迹展示了这种联系,机器人学到了“骨折”这个词专门与骨骼图像中的锯齿状线条相关联。

研究人员还展示了这些鼠标轨迹可以使用其他现有工具转换为“掩码”(勾勒物体轮廓的形状)。这意味着这些数据可以用于教机器人如何执行更复杂的任务,例如自动勾勒肿瘤或器官的轮廓,而无需人类手动绘制每一个轮廓。

简而言之

论文表示:“我们在 YouTube 上发现了一个免费、高质量教学数据的金矿,在那里医生在解释医学图像时会进行指点。我们将这些视频转化为了一个海量数据集,其中文本与特定的图像部分完美对齐。当我们使用这些数据训练一个新的 AI 模型时,它成为了我们见过的理解医学图像最强的模型,证明了‘指着说话’是一种教导计算机的高效方式。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →