← 最新论文
📄 medicine

Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting

ThyroidXAgent 是一个可审计且具备临床医生交互能力的代理式人工智能系统,它集成了专门的诊断工具,用以协调甲状腺结节的定位、风险分层及基于证据的报告生成,从而显著提高不同临床数据集下的诊断准确性、一致性和效率。

原作者: Guanbin Li, Haifan Gong, Shiyu Chen, Baidong Wang, Yuqi Wang, Shijie Wang, Guoliang You, Xinyu Xiong, Haowei Wang, Mingzhi Mao, Dexing Kong, Qinghua Liu, Wei Lou, Fei Chen

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Guanbin Li, Haifan Gong, Shiyu Chen, Baidong Wang, Yuqi Wang, Shijie Wang, Guoliang You, Xinyu Xiong, Haowei Wang, Mingzhi Mao, Dexing Kong, Qinghua Liu, Wei Lou, Fei Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:医生拥有一位超级聪明的助手,它不仅能给出答案,还能展示它的“解题过程”。在医学影像领域,特别是利用声波(超声波)观察甲状腺时,这具有重大意义。通常情况下,计算机试图一次性完成所有工作:寻找肿块、测量大小、判断是否危险以及撰写报告。但就像一个学生试图在写论文的同时还要解数学题并画图一样,他们往往会感到困惑或犯下无人察觉的错误。这篇论文介绍了一种全新的思维方式:与其让一个巨大的大脑处理所有事情,不如想象一支由专家组成的团队,每位专家都精通一件微小的任务,并在一位项目经理的严密监督下协同工作。这位项目经理不仅给出最终成绩,还会为每一个决策、每一项测量和每一个发现的线索记录一份详细的、循序渐落地日记。这份“日记”被称为“可审计的证据记录”(auditable evidence record),它允许人类医生查看工作内容,并说:“等等,那个测量值看起来不对,”然后进行修正,并让计算机根据新的事实立即更新其结论。

该论文介绍了一个名为 ThyroidXAgent 的系统,它充当了甲状腺超声诊断中的那位聪明“项目经理”。可以将甲状腺想象成你脖子中蝴蝶形状的腺体,它有时会长出一些小疙瘩,称为结节。医生需要找到这些疙瘩、测量它们,并判断它们是无害的(良性)还是危险的(恶性)。传统上,AI 系统试图成为“全能型”工具,但它们往往像一个“黑匣子”:你输入一张图像,报告就弹了出来,但你完全不知道它是如何得出的结论。如果 AI 出错了,医生必须从头开始。

ThyroidXAgent 通过将工作分解为一套工作流来改变游戏规则。首先,它扮演指挥家的角色,调用不同的专业工具来执行特定任务。其中一个工具是绘制结节完美轮廓的专家(分割);另一个是精通测量该轮廓的大师;第三个工具则通过观察纹理和形状来推测结节是否危险。该系统并非仅仅给出一个“是/否”的最终答案,而是收集所有这些中间结果——轮廓、测量值、纹理线索——并将它们存储在一个共享的“证据库”中。这是核心创新点:这些证据是可审计的。这意味着人类医生可以打开这个“储物柜”,查看 AI 绘制的轮廓,如果发现轮廓略有偏差,可以通过快速点击进行修正。随后,系统会根据修正后的轮廓立即重新计算测量值和风险评估。这就像一个计算器,允许你在等式中间修改一个数字,并立即看到最终答案的变化,而不是强迫你重新输入整个等式。

研究人员在海量数据上对该系统进行了测试,其中包括约 30 万张超声图像和来自许多医院及不同机器的 2.4 万份报告。他们发现,通过使用这种“专家团队”的方法,该系统在寻找和测量结节方面表现出了惊人的准确性,达到了 87.21% 的得分(Dice 分数),这是一个非常高的水平。它在区分良性和恶性结节方面也表现出色,准确率得分(AUROC)达到了 0.9466。更令人印象深刻的是,当医生使用该系统辅助编写报告时,他们的报告与专家标准的一致性显著提高,从大约 70% 跳升到了 86% 以上。

研究还表明,该系统节省了时间。在使用这款 AI 助手时,医生在绘制轮廓方面节省了约 35.9% 的时间,在编写报告方面节省了 27.4% 的时间。但最重要的发现不仅仅是速度,而是信任。因为系统展示了它的工作过程,医生不必盲目信任 AI。他们可以验证证据。例如,如果 AI 因为形状原因判定结节危险,医生可以查看形状分析来确认。如果 AI 判断错了,医生可以修正形状,然后 AI 会更新其结论。这创造了一种伙伴关系:AI 处理繁重的计算工作,而人类负责最终判断,两者之间有着清晰的证据链相连。

论文还引入了一种衡量 AI 撰写报告质量的新方法,称为 ThyClinScore。标准的计算机文本测试通常只检查单词是否匹配原文,就像拼写检查器一样。但在医学领域,如果把“结节在左侧”写成“结节在右侧”,即使单词拼写完全正确,也是一场灾难。ThyClinScore 检查的是医学事实(如大小、位置和结节类型)是否正确,而不仅仅是句子听起来是否相似。使用这一新指标,ThyroidXAgent 证明了它能够生成具有医学准确性且基于实际扫描证据的报告,而不是仅仅猜测报告应该怎么写。

简而言之,这篇论文表明,医学 AI 的未来不在于用一个单一的、神奇的计算机大脑来取代医生。相反,它在于构建一个透明、协作的团队,其中一个智能“经理” AI 协调各种专业工具,记录每一步骤的详细记录,并允许人类医生介入、修正记录,并带着信心做出最终决定。它将 AI 从一个神秘的预言家变成了一个乐于助人、诚实且能展示其“解题过程”的得力助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →