Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context
Harrison.Rad 1.5 是一款放射科专用的多模态大语言模型,通过三阶段流水线训练而成,能够根据多样化的 X 线和乳腺摄影图像、临床背景及既往研究生成结构化和非结构化报告,并在包括模拟 FRCR 考试在内的临床基准测试中达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于 Harrison.Rad 1.5 技术报告的解释,已将其转化为通俗易懂的语言,并采用了创意类比。
核心问题:扫描量激增,医生不够用
想象一下,一家医院里的 X 光和扫描影像的数量正像一个迅速膨胀的气球一样增长,但放射科医生(解读影像的医生)的增长速度却像蜗牛爬行一样缓慢。这导致了大量未处理的扫描报告堆积如山的“交通堵塞”。
论文指出,仅仅通过招聘更多医生或加快培训速度并不能解决问题。真正的解决方案是为现有的医生配备一个“超级助手”,由它来承担撰写报告的大部分繁重工作,这样医生只需进行最后的审核即可。
解决方案:Harrison.Rad 1.5 (HR1.5)
请不要把 HR1.5 仅仅看作是一个只会数骨头的简单计算器,而要把它看作是一个高度专业化的医学实习生,它已经阅读了数百万份 X 光片并撰写了数百万份报告。
- 它的功能: 它观察 X 光片,阅读患者病史(例如“患者有咳嗽症状”),检查患者以前的 X 光片以查看发生了哪些变化,然后起草一份完整的医疗报告。
- 它的覆盖范围: 它不仅仅针对胸部 X 光。它还能处理脊柱、髋关节、膝盖、腹部甚至乳腺 X 光片。它是平片领域的“全才”,而不仅仅是针对某个特定身体部位的专家。
如何训练:三阶段“魔鬼训练营”
论文描述了一个三阶段的训练过程,就像你在培训一名新员工一样:
- 研读手册(领域适应): 首先,AI 被喂入了大量的真实放射科报告,使其学会了医生使用的特定语言。它明白了“不透明度”(opacity)不仅仅是指一个模糊的点,而是一个特定的医学术语。
- “找不同”游戏(对比学习): AI 被展示了数百万对图像和报告。至关重要的是,它还看到了“硬负样本”(hard negatives)——即看起来几乎完全相同但存在微小且关键差异的图像(例如,细微的骨折与没有骨折的区别)。这教会了 AI 去关注那些具有临床意义的细节,而不仅仅是图像的整体形状。
- 与医生角色扮演(指令微调): 最后,AI 练习了如何与医生进行对话。它学会了如何回答特定问题(“是否存在骨折?”)以及如何按照医院要求的精确风格起草报告。
硬件升级: 团队升级了 AI 的“大脑”,使其能够在最新、最强大的计算机芯片(NVIDIA B200 级)上运行,这使得它处理数据的速度和效率比之前的版本高得多。
大考: “医学执业医师资格考试”
为了证明这个 AI 确实很出色,研究人员不仅让它进行猜测,还给它举行了一场模拟英国皇家放射科医学院(FRCR)考试。这是人类医生成为专家必须通过的真实且困难的考试。
- 结果: HR1.5 是唯一通过该考试的系统(包括其他著名的 AI 模型和通用聊天机器人)。
- 对比: 通用 AI 模型(比如你在网上聊天的那些)得分低于 50%(不及格),而 HR1.5 的得分足以通过考试。它甚至超越了之前的版本(HR1)以及其他专门的医学 AI。
为什么标准测试会失效(“词汇匹配”陷阱)
论文指出了一项测试 AI 的常见缺陷。大多数测试检查的是 AI 的答案是否使用了与正确答案相同的词汇(就像老师批改拼写测试一样)。
- 问题所在: 一个 AI 可能写出了一份完美的医疗报告,但使用了略微不同的词汇,标准测试就会判定它错误。或者,它可能写了一份胡言乱语的报告,但恰好包含了正确的关键词,测试却会判定它正确。
- 解决方法: 研究人员创建了一种新的评分系统,称为**“发现-诊断”(Findings-Diagnosis)。它不再检查词汇是否匹配,而是检查医学真实性**。AI 是否发现了肺炎?它是否正确说明了心脏大小正常?它是否避免了凭空捏造不存在的疾病?这个系统更加严格,也更诚实地反映了临床准确性。
它的思考方式:“可解释性”
人们对 AI 最大的担忧之一是它是一个“黑匣子”——它给出了答案,但你不知道为什么。论文展示了 HR1.5 如何尝试实现透明化:
- 热力图: 当 AI 说“这里有骨折”时,它可以高亮显示 X 光片上导致它得出此结论的确切位置。这就像 AI 用手指着证据在说话。
- 置信度计量器: AI 可以告诉你它有多大的把握。如果它面对的是一张奇怪、陈旧或模糊不清的图像,它会说:“我对这个不是 100% 确定。”
- 检查“幻觉”: 系统内置了一个“测谎仪”。如果 AI 因为困惑而只是在瞎猜,系统可以检测到其内部信号不稳定,并降低其置信度分数。
“胸腔里的苹果”测试(分布外测试)
研究人员测试了如果给 AI 展示它从未见过的东西会发生什么。他们展示了一张人体胸腔内有一个苹果的虚假 X 光片。
- 结果: AI 并没有说“我不知道那是什么”。相反,它自信地表示:“这看起来像是一个乳房植入物。”
- 教训: 这展示了一个局限性。如果 AI 看到全新的事物,它会试图将其归入它已知的某个类别中。它并不完美,无法识别所有的“未知之未知”,因此仍需要人类医生进行复核。
总结
Harrison.Rad 1.5 是一款专门设计的 AI 工具,旨在帮助放射科医生更快、更准确地撰写报告。它通过了其他 AI 均失败的模拟专家考试。它不是为了取代医生,而是作为一个由医生进行审核的“草稿撰写者”。
重要提示: 论文明确指出,该工具尚未获准用于临床用途。它目前是一个研究原型。它不是医疗设备,你目前还不能用它来诊断患者。发布它是为了让科学家们进行研究、改进,并探索如何使其在现实世界中安全应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。