Default-filled outcome labels in a deployed cognitive-screening programme: an operator-level audit and the construction of twenty-four language-model arms
本研究表明,在训练前对常规临床标签进行操作层面的偏差审计至关重要,并且虽然在有限的专家数据上进行标准微调和强化学习未能超越传统的逻辑回归,但通过将前沿模型知识蒸馏至本地 4B 参数模型实现了更优越的性能,从而为认知筛查项目建立了一套实用的部署方案。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在中国各社区卫生服务中心的寂静角落里,每天都在产生海量的医疗数据。居民们前来检查记忆力和思维能力,回答一系列关于日常生活的问题并完成简短的认知测试。这些回答被记录在数字系统中,形成了一个庞大的健康档案库。多年来,研究人员一直希望利用这个档案库来教计算机如何识别认知功能下降(如轻度记忆丧te或痴呆症)的早期征兆,而无需让专科医生审查每一份文件。这个想法很简单:如果计算机能从成千上万份常规记录中学习,它就能比目前的系统更快、更便宜地识别出需要护理的人群。然而,使用这些常规记录存在一个隐藏的问题。将数据输入系统的人并不总是医生;他们通常是诊所的工作人员或志愿者。他们录入信息的质量因人而异,有时数据是在没有人实际检查患者状况的情况下自动填充的。这导致了一种情况:计算机试图从一本充满错误的教科书中学习,使得人们很难判断计算机究竟是在学习真相,还是仅仅在记忆错误。
一组研究人员决定通过调查一个正在社区开展的大规模特定认知筛查项目来正面解决这个问题。他们并没有立即构建新的计算机模型,而是首先像审计员一样,通过检查原始数据来观察是谁在录入数据以及录入的准确性如何。他们发现了一个惊人的模式:整个数据库中近百分之四十的数据是由极少数账户录入的,而这些账户无论处理了多少名患者,从未记录过任何一例认知障碍病例。换句话说,这些账户很可能只是对每个人都点击了默认的“正常”按钮,而不顾实际的测试结果。这并非随机噪声,而是集中在特定用户账户中的系统性错误。研究人员进行了测试并排除了这种现象是由批量填充时间戳的计算机故障引起的可能性,从而确认这确实是一个人为行为问题。一旦识别出这些有问题的账户,他们便剔除了这些数据以观察剩余情况,结果显示该计划中真实的受损率远高于原始数据所显示的水平。
在获得了这种经过清理的理解后,研究人员随后测试了二十四种训练计算机预测认知状态的方法。他们想看看现代人工智能,特别是大语言模型,是否能超越现有的简单计算机程序。现有的程序是一个直观的统计工具,它通过观察二十一个特定变量(如年龄、受教育程度和测试得分)来进行预测。研究人员构建了一个包含新模型的矩阵,其范围涵盖了从小型本地安装的计算机到庞大且功能强大的人工智能系统。他们尝试使用常规数据、仅使用经由专科医生验证的诊断数据,甚至使用两者的混合数据来训练这些新模型。他们还测试了先进的技术,例如让计算机在回答之前进行“出声思考”,或者使用强化学习——这是一种通过试错来最大化奖励的学习方法。
结果令人惊讶且结论明确。当使用常规数据或即使是使用少量的专家诊断数据进行训练时,没有任何复杂的模型能够击败现有的简单统计工具。事实上,先进的技术往往会让模型的表现变得更差。例如,当研究人员要求模型逐步解释其推理过程时,准确度反而下降了。当他们尝试使用强化学习在仅有的几百个专家案例上进行微调时,性能显著低于简单的基准线。这项研究表明,如果数据存在缺陷,或者训练集太小以至于无法有效地教导复杂系统,那么仅仅拥有更强大的计算机或更复杂的训练方法并不能保证获得更好的结果。那个简单的工具仍然是最可靠的预测器,因为它经过了良好的校准,且不会被数据中的噪声所干扰。
然而,研究人员确实找到了一个效果优于其他任何方法的路径。他们使用了一个强大且最先进的人工智能模型作为“老师”,这个模型虽然太贵且运行太慢,无法直接在诊所中使用。这个“老师”模型观察常规记录并为它们赋予了新的、高质量的标签。随后,研究人员提取出一个较小的、本地化的 AI 模型,并教它去模仿“老师”的答案。这个过程被称为“知识蒸馏”,它使小模型能够在不需要任何专家诊断标签的情况下,通过学习“老师”的专业知识来进行训练。其结果是,这个小型的、快速运行的模型可以在标准计算机上运行,并且其表现优于简单的统计工具以及“老师”本身,且具有统计学意义上的显著提升。这种成功是因为小模型能够平均化“老师”可能产生的细微误差,从而创造出一个更稳定、更准确的预测器。
该研究得出结论:在构建复杂的医疗人工智能系统之前,首先对数据进行审计至关重要。研究人员发现,百分之四十的常规标签实际上是无效的,因为它们是由特定账户默认填充的,利用这些数据进行训练并无益处。他们证明了像强化学习或让计算机进行逻辑推理这类复杂方法,在面对噪声数据或专家案例过少的情况时并无帮助。相反,最有效的策略是使用功能强大的现成人工智能模型作为标注工具来清理常规数据,然后将这些知识蒸馏到更小、可部署的模型中。这种方法产生了一个最准确且可靠的系统来识别认知障碍,证明了有时使用先进技术最好的方式并不是让它做出最终决策,而是利用它来教导一个更简单、更实用的工具如何正确地完成工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。