← 最新论文
💻 computer science

A Multi Center Breast FNAC Whole-Slide Cytology Dataset for AI-Assisted Patch-Wise Classification Using C1 to C5 Reporting Categories

本文介绍了一个多中心乳腺细针穿刺细胞学(FNAC)全切片细胞学数据集,该数据集包含来自321名印度患者的470张图像,并具有7,398个经专家标注的补丁(patches),其报告标签为C1–C5,旨在支持AI辅助的补丁级分类。

原作者: Garima Jain, Abhijeet Patil, Surabhi Jain, Sanghamitra Pati, Amit Sethi, Sandeep Mathur, Pulkit Verma, Nishi Halduniya, Jatin Kashyap, Sharat Kumar, Simmi Kharb, Sunita Singh, Sucheta Devi Khuraijam
发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Garima Jain, Abhijeet Patil, Surabhi Jain, Sanghamitra Pati, Amit Sethi, Sandeep Mathur, Pulkit Verma, Nishi Halduniya, Jatin Kashyap, Sharat Kumar, Simmi Kharb, Sunita Singh, Sucheta Devi Khuraijam, Sushma Khuraijam, Ratan Konjengbam, Arvind Kumar, Deepali Tirkey, Saurav Banerjee, Shivani Kalhan, Rakesh Kumar Gupta, Ranjana Solanki, Deepika Hemranjani, Shashank Nath Singh, Uma Handa, Manveen Kaur, B. G. Malathi, Yogender P., Niraj Kumari, Shruti Gupta, Indu R. Nair, Vidya C., Basumitra Das, Sunil Kumar Komanapalli, Ravindra Karle, Tanaya Kulkarni, Vandana Raphael, Biswajit Dey, Vaishali Gaikwad, Nilam Adhav

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一台计算机如何成为一名名侦探。为此,你需要向它展示数百万个线索。在医学领域,发现早期乳腺癌最重要的线索之一,就是通过针头采集的微小细胞样本,这被称为细针抽吸细胞学检查(FNAC)

这篇论文本质上是研究人员为教 AI 如何阅读这些细胞样本而编写的“训练手册”和“巨大的线索箱”。

以下是他们是如何完成这项工作的故事,分为几个简单部分:

1. 大规模收集(“巨型图书馆”)

研究人员并没有只看一家医院;他们从印度各地的 13 个不同医疗中心收集了样本。你可以把它想象成从 13 个不同的拼图盒中收集碎片,以拼凑出一幅宏大、完整的图像。

  • 参与者: 他们收集了来自 321 名患者的数据。
  • 图像: 他们将包含细胞的物理载玻片转化为了 470 张巨大的数字照片(称为全切片图像或 WSI)。
  • 多样性: 就像照片可以添加不同的滤镜一样,这些玻片使用了两种不同的染色方法(巴氏染色 Papanicolaou 和 May–Grünwald–Giemsa),使细胞更加鲜明。他们使用相同的尖端相机拍摄所有照片,以确保图像的一致性。

2. “五星级”评分系统

当人类医生观察这些细胞时,他们不仅仅是说“癌症”或“非癌症”。他们使用一个特定的 5 级量表(C1 到 C5)来描述所见内容:

  • C1: 样本是空的或破碎的(就像试图阅读一本缺页的书)。
  • C2: 一切看起来正常且健康(良性)。
  • C3: 有些地方看起来有点奇怪或异常(非典型)。
  • C4: 看起来很可疑,可能像是癌症。
  • C5: 确定是癌症(恶性)。
    这个数据集的目标是教 AI 识别这五个特定的类别,而不仅仅是一个简单的“是/否”答案。

3. “放大”过程(分块分类)

这是最聪明的部分。单张数字玻片非常巨大——就像一张高分辨率的整座城市照片。如果你一次性把整座城市喂给 AI,它会感到困惑。

  • 解决方案: 研究人员扮演了编辑的角色,从大图中剪切出特定的“线索”。他们手动找到了玻片中有趣的部分,并将它们切割成较小的正方形,称为图像块(patches)
  • 结果: 从 470 张大图中,他们创建了 7,398 个较小的“线索”图像
  • 标记: 专家医生(病理学家)查看了这 7,398 个微小正方形中的每一个,并为它们贴上了标签(C1 到 C5)。随后,一位资深医生复核了他们的工作,以确保标签完全准确。

4. 箱子里有什么?

研究人员正在免费分享整个收藏。如果你下载它,你会得到:

  • 巨大的照片: 470 张原始高分辨率切片。
  • 线索: 7,398 个剪切出来的图像块,已准备好供 AI 研究。
  • 地图: 一个数字地图(GeoJSON),告诉你每个线索在原大图中的确切位置。
  • 说明书: 一本解释每项数据含义的字典,以及一份贡献者名单。

5. 使用线索的重要规则

论文中给出了几个非常重要的警告,关于如何使用这些数据:

  • 它是训练工具,而非最终结论: 这些微小正方形的标签是“经过专家验证的”,但它们仅用于训练。在现实世界中,医生不能仅凭一个微小的正方形就做出诊断;他们需要观察全局、结合患者病史和其他检查。
  • “缺失”的线索: 该数据集是“富集”过的,这意味着医生只剪切出了那些有趣的部分。他们并没有剪切玻片上的每一个正方形。因此,AI 学习的是“最好的”部分,而不是整个杂乱的背景。
  • 不平衡性: “正常”(C2)和“癌症”(C5)的线索比“异常”(C3)或“破碎”(C1)的线索要多得多。AI 需要经过仔细训练,以免被这种不平衡现象所误导。

总结

简而言之,这篇论文是在说:“我们建立了一个庞大、高质量的印度乳腺细胞图像库。我们将它们切割成带有标签的小块,并将这张地图分享给世界,以便任何人都能构建 AI 来帮助医生更早、更准确地发现乳腺癌。”

这些数据可以在名为 Zenodo 的网站上免费下载并用于研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →