A simulation-based framework for sizing paired benchmarks in the evaluation of clinical artificial intelligence, applied to 168 expert-level dyslipidaemia items
本文提出了一种基于模拟的框架,用于确定配对临床人工智能基准评估中必要的样本量,以解决传统方法的局限性,并通过一项血脂异常研究证明,决定比较结论是否在统计学上可达到的,是预先计算的样本量,而非系统性能本身。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的医疗技术领域,新一代人工智能系统正在接受训练,以用于诊断疾病并推荐治疗方案。这些系统通常构建在庞大的数据网络之上,并越来越多地接受与人类专家对比的测试,以观察谁的表现更佳。比较它们的标准方法是给计算机和医生提供同一套医学问题,并统计正确答案的数量。然而,该领域出现了一个关键问题:研究人员往往不知道需要多少个问题才能进行公平的比较。如果测试过短,聪明的计算机可能会仅仅因为运气好就答对所有问题,从而让人无法判断它究竟是真正比人类更优秀,还是仅仅运气好。相反,如果两个系统之间的差异非常微小,短时间的测试可能会完全忽略这种差异,导致科学家们错误地得出两者完全相同的结论。如果没有一个关于要提问多少个问题的明确计划,这些高风险比较的结果可能会产生误导,使医院和患者对哪种技术才是安全有效的感到困惑。
一个研究小组致力于通过创建一个设计此类测试的新框架来解决这个测量问题,并将该框架应用于一个复杂的医学挑战:高胆固醇及相关血脂异常的管理。他们不仅仅是进行了一次测试;他们首先精确计算了检测特定性能差异所需的题目数量。通过一种模拟数千种潜在测试结果的方法,他们确定了要可靠地发现一个微小但有意义的优势,他们需要的题目库要比以往研究中常用的几十个题目大得多。随后,他们构建了这个更大的测试,包含168个专家级的医学场景,并进行了试验。其目标是评估一种新型的人工智能,这种人工智能将强大的语言模型与一套严格的安全规则相结合,检查这种结合是否能比单纯的语言模型或其他先进的计算机以及执业医生,在准确性和安全性方面有所提升。
这次经过精心设计的实验结果揭示了一个清晰的性能等级。这个采用了“神经符号”方法(即通过一套锁定的医学规则来检查自身工作)的新系统,正确回答了97%的问题。这比其底层的引擎有了显著的进步,后者的正确率为88%,同时也超越了最优秀的个体医生和其他领先的人工智能模型。研究人员能够精准定位这种进步的来源。他们发现,系统中不同部分相互交流的复杂内部组织本身几乎没有带来什么价值。真正的收益来自于“符号验证器”,即那个充当严格编辑的角色,负责根据既定的医学规则检查人工智能的推理过程。这一规则检查步骤是准确率提升的主要原因,它纠正了未经验证的系统原本会犯的错误。
除了简单的准确性之外,研究还考察了这些系统如何处理困难或模糊的医学案例,即那些可能不存在单一正确答案的情况。在此方面,新系统展现出了明显的安全性优势。面对这些模糊的情况时,带有规则检查器的完整系统在85%的情况下拒绝给出答案,转而选择将其标记为需人工审核。相比之下,没有规则检查器的底层引擎仅在4%的情况下表现出犹豫,往往会匆忙给出一个可能不安全的建议。这种行为表明,该系统的设计成功地将“谨慎”置于“自信”之上,这是医疗工具的一项至关重要的特质。研究人员还注意到,问题的质量至关重要:该系统的优势在最高质量、定义最明确的医学案例中最为显著,这表明当规则本身清晰明确时,基于规则的检查效果最好。
这项研究最重要的发现不仅在于哪个系统胜出,还在于测试本身是如何设计的。研究人员将他们这次大规模的新结果与之前针对同一系统进行的、仅使用24个问题的较小规模研究进行了对比。在之前的那个较小的测试中,该系统及其底层引擎都得到了满分,这使得人们无法分辨两者的区别。新的大规模测试证明,早期的结果是由于测试过短而无法揭示差异所导致的假象。通过预先计算所需的规模,团队确保了其结论的稳健性。他们还确定了哪些比较仍然难以通过人类规模的测试来解决,指出若要检测系统内部组件之间极微小的差异,则需要一个超过一千个题目的题库,而这种规模目前已超出了人工专家测试的能力范围。
研究结论认为,评估医疗人工智能的未来取决于严密的规划,而非仅仅进行快速的对比。研究人员认为,测试这些工具的机构必须在开始前计算出必要的题目数量,以确保测试足够长,能够检测出对患者安全至关重要的差异。他们发现,虽然新系统表现优异,但其优势具有特定性:它擅长于将严格的规则应用于明确的案例,并在不确定的情况下懂得适时退后。该研究并未声称该系统已准备好立即投入临床护理,因为并未涉及真实患者,但它提供了一条清晰的、基于证据的前行路径。它表明,通过正确的规模和设计,我们可以超越猜测,开始以医疗人工智能所要求的精准度,去衡量其真实的潜力和局限性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。