RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography
RadAgent 是一种能够使用工具的 AI 智能体,它通过提供可解释的逐步推理轨迹来增强胸部 CT 报告的生成,与现有的 3D 视觉语言模型相比,显著提高了临床准确性、鲁棒性和忠实度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,放射科医生观察 3D CT 扫描影像,就像是在一个巨大的、多层叠放的草堆中寻找几根特定的针。这是一项庞大的工作,需要逐层检查切片。
长期以来,AI 工具(被称为“视觉语言模型”或 VLM)在观察这些扫描影像并撰写报告方面表现出色。但它们的工作方式就像一个黑盒:它们观察图像后会立即吐出最终报告。如果医生想知道 AI 是如何发现某个特定问题的,或者为什么漏掉了某个问题,AI 无法解释自己。它只是给出了答案。
RadAgent 登场:侦探型 AI
该论文的作者构建了一种新型 AI,名为 RadAgent。RadAgent 不再是一个黑盒,它更像是一个正在破解案件的侦探。
以下是它的工作原理,使用了一个简单的类比:
1. 初步猜测(“直觉”)
当 RadAgent 接收到 CT 扫描时,它不会立即猜测答案。首先,它会使用一种标准的 AI 工具来写一份初步草案。这可以看作是侦探根据对犯罪现场的快速扫视所产生的初步“直觉”。
2. 清单(“待办事项列表”)
侦探不会仅仅依赖直觉。RadAgent 拥有一份诊断清单(类似于医生的标准操作程序)。它必须检查特定的事项:心脏是否正常?是否有积液?是否有微小的结节?
3. 工具箱(“专业小工具”)
这是 RadAgent 与众不同之处。它不会试图只靠自己的大脑完成所有事情。相反,它拥有一个专业小工具箱(软件工具),它可以调用这些工具:
- 分割工具: 就像一个自动勾勒心脏或肺部轮廓并进行测量的“高亮笔”。
- 切片工具: 就像一个“翻页器”,可以放大查看 3D 扫描中的特定 2D 切片。
- 提问工具: 一个可以观察特定切片并回答特定问题(如“这里是否有积液?”)的工具。
4. 调查过程(“循序渐进”)
RadAgent 遵循一个循环:
- 计划: “我需要检查积液。”
- 行动: 它调用“积液分割工具”。
- 观察: 工具回答:“这里确实有积液。”
- 更新: RadAgent 将此记录在一个“便签”(证据笔记)中。
- 重复: 它转向清单上的下一项,比如检查肺结节,调用不同的工具,并将结果添加到便签中。
只有在通过这些工具收集了足够的证据后,它才会撰写最终报告。
为什么这更好?(研究结果)
论文将 RadAgent 与旧有的“黑盒”AI(称为 CT-Chat)进行了对比测试,发现有三大优势:
- 更准确: 由于 RadAgent 使用特定工具反复核实其工作,它能更正确地发现问题。论文指出,与旧 AI 相比,它的准确率提高了约 35%。
- 更难被误导: 研究人员尝试通过提供虚假提示(例如,在没有肿瘤的情况下告诉它“我认为这里有一个肿瘤”)来“欺骗”AI。旧的 AI 通常会相信虚假提示并写出错误的报告。然而,RadAgent 会使用工具检查实际扫描影像,忽略虚假提示,坚持事实。它在应对此类误导方面的鲁棒性(稳健性)提高了 42%。
- 更具“忠实度”(诚实): 这非常重要。如果旧的 AI 因为虚假提示而改变主意,它只会写下新的答案而不会说明原因。这属于在推理过程中撒谎。由于 RadAgent 会保留其步骤的“痕迹”,它可以清晰展示哪些证据导致了它的结论。旧的 AI 具有 0% 的忠实度(它从未承认其推理受到了外部提示的影响),而 RadAgent 达到了 37%。
核心结论
该论文认为,通过将 AI 转变为一个使用专业工具并保留调查记录的循序渐进的侦探,我们得到的医疗报告不仅更加准确,而且更加透明且值得信赖。医生可以通过查看“侦探的便签”来确切了解 AI 是如何得出结论的,而不是仅仅接受一个黑盒式的猜测。
注:论文提到,该系统目前需要强大的计算机配置(多块显卡)来同时运行所有这些工具,并且仍在不断完善,以更好地解释其推理过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。