← 最新论文
⚡ electrical engineering

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

该论文提出了 Colon-Bench,这是一个通过多阶段智能体工作流生成的全结肠镜检查视频大规模密集病变标注基准,包含 528 个视频及丰富的时空与临床描述数据,旨在评估多模态大语言模型在医学领域的性能并提出了提升零样本表现的“结肠技能”提示策略。

原作者: Abdullah Hamdi, Changchun Yang, Xin Gao

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah Hamdi, Changchun Yang, Xin Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Colon-Bench 的突破性项目,它的核心任务是给“结肠镜检查视频”做超级详细的标注,并以此测试人工智能(AI)在医疗领域的真实水平。

为了让你更容易理解,我们可以把这篇论文的内容想象成训练一位“超级实习医生”的过程

1. 背景:为什么需要这个?

现状: 结肠癌是杀手,但早期筛查(做肠镜)非常痛苦且昂贵。医生看肠镜视频就像在大海里捞针:视频很长(有时长达两小时),画面模糊,还有粪便、气泡遮挡,病变(息肉、溃疡等)又小又少,很容易漏看。
问题: 以前的 AI 数据集太“简单”了。它们只教 AI 认一种东西(比如只认息肉),而且只给几张静态图片。但真实的肠镜是连续的视频,病变有十几种(出血、溃疡、肿瘤等),而且 AI 需要像医生一样理解“这是什么”、“在哪里”、“长什么样”。
目标: 我们需要一个超级详细的“题库”,里面包含成千上万小时的真实视频,并且每一帧都标得清清楚楚,用来训练和考试新一代的 AI。

2. 核心创新:Colon-Bench 是怎么做出来的?

这就好比我们要给一本厚厚的、全是乱码的“天书”做翻译和标注。如果让人工一个个看,累死也做不完。于是,作者设计了一套**“智能流水线”(Agentic Workflow)**:

  • 第一步:AI 初筛(像“海选”)
    先用一个聪明的 AI 模型(VLM)快速浏览所有视频,圈出“这里好像有点不对劲”的片段。这时候,它圈出的东西很多,但很多是误报(比如把一块肉渣当成了息肉)。
  • 第二步:AI 互查(像“互相挑刺”)
    让另一个 AI 模型拿着“放大镜”去检查第一个 AI 圈出的东西。如果它确认“这确实是个病变”,就保留;如果是误报,就扔掉。
  • 第三步:人类专家把关(像“最终考官”)
    最后,由经验丰富的外科医生(人类)快速浏览剩下的片段。因为前面的 AI 已经过滤掉了大部分垃圾,医生只需要确认那剩下的少数几个,效率极高。
  • 结果: 这套流程就像层层过滤的筛子,最终从 23 小时的原始视频中,提炼出了 13 小时最精华、标注最完美的视频片段。

这个数据集有多强大?

  • 规模: 528 个完整视频,46 万帧画面。
  • 细节: 标注了 30 万个 边界框(框出病变位置),21 万个 分割掩码(像涂色一样把病变轮廓描出来),还有 13.3 万字 的医生手写描述(比如“这是一个平坦的息肉,位于结肠右半部分”)。
  • 种类: 涵盖了 14 种不同的病变,不仅仅是息肉,还有出血、溃疡、憩室等。

3. 大考:用这个数据集考考现在的 AI

作者把这个数据集当作“考卷”,拿去测试了目前世界上最先进的多模态大模型(MLLMs)(比如 Gemini, GPT-5, Qwen 等)。这些模型不仅能看图,还能像人一样“思考”和“对话”。

考试题目有三类:

  1. 找茬(检测): 视频里有没有病变?在哪里?
  2. 描边(分割): 把病变的轮廓精准地画出来。
  3. 问答(VQA): 医生问:“这个病变长什么样?在哪个位置?是良性的还是恶性的?”AI 需要回答。

考试成绩如何?

  • 惊喜: 现在的通用大模型(如 Gemini 3 Pro)表现惊人!它们在医学视频上的定位能力,甚至超过了专门为此设计的传统医疗 AI 模型(如 SAM-3)。这说明通用的“大脑”只要给足数据,也能成为“专科医生”。
  • 不足: 有些模型虽然能回答问题,但容易“幻觉”(瞎编),或者分不清相似的病变(比如把“憩室”看成“溃疡”)。

4. 绝招:给 AI 传授“结肠科秘籍” (Colon-Skill)

这是论文最有趣的部分。作者发现,AI 犯错是有规律的(比如总把“无蒂息肉”看成“有蒂息肉”)。

于是,他们做了一件很聪明的事:

  • 分析错题: 把所有模型答错的题目收集起来,分析它们为什么错。
  • 编写秘籍: 把这些经验总结成一段**“专家提示词”(Colon-Skill)**。
    • 比如秘籍里写:“注意!如果看到一个圆圆的黑坑,那是‘憩室’(肠道上的小洞),不是‘溃疡’(烂掉的肉)。如果息肉没有明显的‘柄’,那就是‘无蒂’的,别瞎编。”
  • 效果: 当把这段“秘籍”作为提示词喂给 AI 时,AI 的考试分数直接提升了 9.7%,而且不需要重新训练模型,只需要“读”一下秘籍就行。

总结

这篇论文就像是在说:

“我们造了一个超级详细的肠镜教学视频库,用AI 流水线高效地做好了标注。测试发现,现在的通用 AI 大脑已经很有潜力成为医疗助手了,但还需要一点**‘专家经验’(Colon-Skill)**的指点,就能把准确率再提升一大截。未来,这套系统可以帮助医生更快、更准地发现癌症,让肠镜检查不再那么可怕。”

一句话概括: 这是一个用AI 辅助 AI,打造医疗级视频数据库,并教给大模型**“行医秘籍”**,从而推动智能医疗落地的里程碑式工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →