← 最新论文
📄 radiology and imaging

AUTONOMOUS LOOP CONSTRUCTION AND SUPERVISION FOR CLINICIAN-ORIENTED MEDICAL-AI RESEARCH

本文介绍了 MARLA,这是一个智能体框架,它使临床医生能够通过自动将高层研究目标转化为可执行的、具有自我修正能力的研究循环,从而自主开展复杂的多模态医学人工智能研究,进而消除对专业人工智能知识的需求。

原作者: Chen, X., Jiang, X., Shan, C., Wang, Z., Li, D., Zhao, C.

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen, X., Jiang, X., Shan, C., Wang, Z., Li, D., Zhao, C.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人工智能在医学领域的承诺,常被描述为连接海量患者数据与人类对清晰答案需求的桥梁。长期以来,医生和研究人员已经具备了识别疾病关键问题并收集必要证据(如医学影像、基因图谱和临床笔记)的能力。然而,将这些原始资产转化为能够从中学习的计算机工作模型的过程,传统上需要一种罕见且困难的协作。这需要一个团队,其中理解疾病生物学的临床医生与理解如何构建处理数据软件的计算机科学家紧密合作。这种伙伴关系往往进展缓慢、成本高昂,并且受限于能够通晓两种语言的专家可用性。近年来,该领域见证了大语言模型的兴起,这些强大的系统能够编写代码并解决复杂问题。这些工具提供了一线希望,即技术壁垒有望降低,使得医生无需专门的工程师团队也能构建自己的专业化人工智能。然而,一个显著的障碍依然存在:虽然这些工具可以编写代码,但在管理整个混乱的医学研究过程方面却显得力不从心,因为该过程涉及不断的测试、修复错误以及在情况出错时调整策略。

一个名为 MARLA 的新系统,由来自同济大学和微软亚洲研究院的研究人员开发,旨在消除这最后一道障碍。MARLA 不仅仅是作为一个在被要求时编写代码的工具,它更像是一个自主监督者,管理着整个医疗 AI 项目的生命周期。研究人员设计该系统,使其能够接收临床医生提出的高层目标,例如“预测哪些肾癌患者面临更高的死亡风险”,并自动将其分解为一系列结构化的步骤。该系统并不只是猜测解决方案;它构建了一个层次化的研究循环。它将主目标分解为更小的、可管理的任务,例如处理不同类型的图像或分析文本记录,然后组织这些任务,使前一步的结果能够自然地进入下一步。如果系统遇到问题,它不会直接停止。相反,它表现得像一名项目经理,监控工作进度,识别特定实验失败的原因,并决定是调整方法、尝试另一种方式,还是带着新的指令重新启动特定部分的流程。

为了测试这种方法是否能在现实世界中真正奏效,团队将 MARка 应用于两个截然不同的医学挑战。第一个挑战涉及利用临床笔记、CT 扫描和组织切片的显微图像,来预测特定类型肾癌患者的生存率。第二个挑战侧重于使用脑部扫描和认知测试结果来诊断并追踪阿尔茨海默病的进展。在这些实验中,MARLA 仅被给予了初始研究问题和原始数据。随后,系统自主处理了数据清洗、合适计算机模型的选择、训练过程以及结果评估。结果令人瞩目。在肾癌研究中,当结合三种类型的数据时,MARLA 达到了 0.889 的性能评分,显著优于其他在增加数据类型后难以提升性能的自动化系统。在阿尔茨海默病研究中,该系统成功应对了复杂的分类任务,其表现往往能达到甚至超过专门为这些领域设计的生物医学智能体。

该研究的一个关键发现是,系统的成功在很大程度上取决于其从自身的错误和过去的成功中学习的能力。随着 MARLA 执行项目,它会捕捉哪些做法有效以及哪些无效,并将这些信息作为可重用的“技能”存储起来。当系统从较简单的任务(如仅分析一种类型的图像)转向涉及多种数据类型的更复杂任务时,它可以应用早期学到的经验。研究人员发现,当 MARLA 被允许使用这些积累的技能时,它不仅产生了更好的结果,而且完成工作的速度也更快,将生成下游多模态开发代码所需的时间减少了 26.6%(从 23.3 分钟降至 17.1 分钟)。这表明该系统不仅仅是在遵循一套僵化的指令,而是正在根据经验真正地调整其策略。此外,该系统在处理现实世界的复杂情况(如缺失数据或标签错误)方面表现出了鲁棒性。在一个案例中,MARLA 检测到了一个隐藏错误,即部分患者的扫描图像被错误标记,它暂停了训练,修正了数据,然后恢复运行,最终提高了最终预测的准确性。

研究还探讨了当该系统构建在不同的底层“计算机大脑”(即大语言模型)之上时的表现。无论研究人员使用的是更强大的模型还是更小、更高效的模型,MARLA 始终能提供强劲的结果。这表明,该系统的价值在于其组织和监督研究过程的方法,而非其用于编写代码的工具的具体智能水平。研究人员明确指出,他们的系统并不是一个能瞬间解决所有医学问题的魔杖。它仍然需要临床医生来定义初始目标并审查最终计划。然而,这项工作证明,将临床问题转化为工作 AI 模型的大量繁琐工作现在可以由自主完成。通过管理规划、构建、测试和完善的复杂循环,MARLA 让临床医生能够专注于疾病本身的科学研究,而让系统处理解决方案的工程实现。这种转变预示着这样一个未来:医生洞察力与功能性 AI 工具之间的差距不再是专业知识的障碍,而是一个可以由单个智能系统管理的流程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →