Agentic systems for breast cancer treatment recommendations
本研究通过 72 例真实临床病例和 1,147 个非对称评分标准,评估了用于乳腺癌治疗建议的代理型大语言模型系统,结果发现尽管表现最佳的配置达到了 0.594 的全局评分,但持续存在的具有临床相关性的失败表明,这些系统目前尚不足以用于无人监督的临床应用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图构建一个终极的“医学超级大脑”,来帮助医生决定治疗乳腺癌的最佳方案。你拥有一个由 72 个真实病例组成的图书馆,涵盖了从早期阶段到晚期阶段的不同案例,你想看看一群 AI 机器人是否能够阅读这些故事并写出一份完美的治疗方案。这正是这项研究所做的工作。
研究人员设置了一个大型测试,包含 72 个真实的临床病例,并创建了 1,147 个具体的检查清单(称为评分标准)来对 AI 的回答进行评分。这些清单是由一个特殊的 AI 创建的,该 AI 可以访问医生的实际决策和医学书籍——而测试用的 AI 并不知道这些信息。这种“秘密优势”确保了评分的公平性,并使其立足于真实的医学现实。
主要发现:机器人并不总是越多越好
团队尝试了 七种不同的方式 来组织这些 AI。其中一些是简单的单脑模型,而另一些则是复杂的“智能体”(agentic)系统,其中一个主机器人充当“老板”,雇佣更小的机器人来处理特定任务,如手术、放疗或药物治疗。有些机器人团队甚至配备了一个专门的“事实核查员”机器人来验证声明,有些甚至可以在感到需要额外帮助时即时雇佣新的机器人。
转折点在于:增加工具和机器人并不一定会让 AI 变得更聪明。
事实上,对于某些模型来说,给予它们访问互联网或 PubMed(一个医学数据库)的权限反而让它们在工作中表现得更差。这就像给一个学生一张借书证和一个计算器,但如果他们不知道如何提出正确的问题或检查数学计算,他们可能只会变得更加困惑。研究发现,“最佳”配置是使用一个强大的模型(Claude Opus 4.8),采用“分而治之”的策略,并配备一个事实核查员以及生成新助手的能力。即便如此,这个表现最好的团队也仅获得了 0.594 ± 0.025 的分数(满分为 1.0)。
“足够好”的问题
论文指出,虽然这些 AI 系统可以生成看起来具有医学相关性的建议,但它们还不足以在医院独立工作。表现最好的 AI 在很大一部分标准上仍未达标。
当一名人类肿瘤科医生(癌症专家)对顶尖 AI 的答案进行仔细审查时,他发现了 八个 AI 经常出错的具体方面:
- 理由错误: AI 得出了正确的答案,但给出了错误的理由(比如说“服用这种药是因为它是蓝色的”,而真实的理由是“它能杀死癌细胞”)。
- 遗漏或错误的建议: 它有时会忘记建议必要的治疗,或者建议了一种危险的治疗方法。
- 虚假引用: 它编造参考文献,或者声称某篇真实的论文表达了它并未表达的内容。
- 过度自信: 即使医学证据不稳固或患者的信息缺失关键细节,AI 也会听起来百分之百确定。
- 信息过时: 它建议了不再符合当前诊疗标准的治疗方法。
这位人类医生仅花费了 1 小时 35 分钟 就审查了其中 一个 AI 生成的计划。这凸显了一个主要问题:如果医生必须对每一项 AI 建议都进行如此长时间的双重检查,那么亲自去做这项工作可能反而更快。
“阶段”带来的惊喜
AI 在早期癌症(第一阶段)上的表现优于更为棘手、复杂的病例(第三阶段)。这可以理解,因为早期癌症的治疗通常遵循严格且简单的规则手册。但当癌症变得复杂时,AI 就会陷入混乱,难以同时兼顾手术、放疗和遗传学等多个方面。
论文排除了哪些可能性
该研究明确反对“越复杂越好”的观点。仅仅因为你构建了一个拥有事实核查员和网络搜索工具的多智能体系统,并不意味着它一定会比简单模型表现更好。在某些情况下,额外的复杂性引入了新的错误。论文也排除了这些系统已准备好进行无人值守临床使用的想法;它们目前还不是一种“即插即用”的解决方案。
我们有多确定?
作者在语言表达上非常谨慎。他们认为智能体系统可能有用,但仍不足以进行无人值守的使用。他们使用严谨的评分系统测量了得分,并通过人工审查观察了具体的失败模式。他们并没有声称已经“解决”了 AI 治疗乳腺癌的问题,也没有声称 AI 比人类医生更好。相反,他们发现虽然这项技术很有前景,但在能够被信任去进行无需人类监督的生死决策之前,仍存在显著的差距。
简而言之,这个 AI 就像一个读过所有书但仍需资深医生检查作业的聪明实习生,因为他们有时会编造事实,在复杂病例面前感到困惑,并且会对自己的错误表现得过于自信。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。