← 最新论文
💻 computer science

Can Coding Agents Build Robust Baselines? A Skill-Based Approach for Automating the Medical Imaging Model-Development Pipeline

本文介绍了一种基于技能且受文献引导的智能体 AI 工作流,该工作流实现了医学影像模型开发全流程的自动化,在多种分割、分类和检测基准测试中成功生成了具有竞争力的深度学习基线模型,同时显著降低了工程投入。

原作者: Eugenia Moris, José Ignacio Orlando

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Eugenia Moris, José Ignacio Orlando

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学影像领域,计算机在观察人体内部结构方面已变得异常出色。它们可以扫描组织、细胞和器官的照片,以发现人类肉眼可能忽略的疾病迹象。为了让这些计算机发挥作用,科学家们构建了从数千个案例中学习的数字模型。然而,创建一个足够可靠且值得信赖的模型是一个缓慢、困难且昂贵的过程。这需要人类专家阅读无数的研究论文,编写复杂的计算机代码,运行数千次测试,并一遍又一遍地调整参数。这种试错循环非常耗时,以至于仅仅为了针对一个新的医学问题建立一个可靠的初始起点,往往就需要花费数周或数月的时间。当今研究人员面临的问题是,计算机是否可以学会承担这些繁重的工作,作为一个能够处理琐碎工作的伙伴,让专家能够专注于更宏观的全局。

一组研究人员开发了一种新的方法来回答这个问题,他们将这个系统称为“AI科学家”。他们并没有要求计算机仅仅去猜测最佳设置,而是构建了一个模仿人类研究人员思维模式的工作流。该过程始于计算机阅读科学文献以理解特定的医学问题,就像学生在考试前通过学习来备考一样。随后,它利用这些知识编写训练模型所需的初始计算机代码。但该系统并未止步于此。它进入了一个主动实验阶段,即提出一项变更、运行一次测试并仔细分析结果。如果变更有效,系统就会保留它;如果变更无效,系统会将这次失败记录为有价值的信息,并尝试其他方案。这个循环在由“哪些做法有效”以及“哪些做法无效”构成的持久记录引导下不断重复,直到计算机构建出一个可用于现实世界的稳健模型。

研究人员在四种不同的医学挑战上测试了这种方法,范围涵盖了从寻找特定类型的细胞到检测组织样本中的肿瘤。他们并没有为每个任务重新设计系统;相反,他们使用同一套技能来应对截然不同的问题。在每种情况下,计算机都从基于现有研究的基础方案开始,然后通过自身的实验进行改进。结果令人瞩目。在一项识别组织结构的挑战中,该系统生成的模型在15支队伍中排名第六。在另一项涉及MILK10k挑战样本分类的任务中,它在125份提交的作品中排名第三十一。或许最令人印象深刻的是,当在涉及不同动物物种和各种类型医学扫描仪的数据集上进行测试时,该模型表现得非常稳定,这表明它学习到的是通用原则,而非仅仅是死记硬背训练数据。

这项成就的意义不仅在于最终的排名,还在于过程的速度和效率。从原始数据到完成模型的整个工作流仅耗时两到七天。在此期间,有一名人类研究人员在场监督整个过程,审查计算机的计划并启动实验,但实际的编码工作以及优化模型所需的数千个微小决策均由计算机处理。该系统证明了它能够在复杂的医学影像开发领域中航行而不迷失方向,利用自身实验的证据来指导下一步行动。它成功避开了无效路径,并加倍投入到显示出前景的策略中,有效地实现了原本消耗大量时间的工程化努力的自动化。

这项研究表明,这种基于技能的方法代表了迈向未来的一项实践性步骤,即人工智能可以在整个模型开发生命周期中为科学家提供支持。通过接管实现和调优等重复性任务,该系统使人类专家能够专注于更深层的科学推理、新假设的生成以及结果的临床解释。虽然该系统尚未实现完全自主,仍需要人类监督以确保安全性和有效性,但结果表明,一种结构化的、以证据为驱动的工作流可以显著降低开发具有竞争力的医学影像工具的门槛。这项工作表明,计算机确实可以学会构建稳健的基准模型,将曾经需要数月专家劳动的过程缩短为短短几天,同时在各种多样且困难的医学任务中保持高水平的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →