Position: Evaluation of ECG Representations Must Be Fixed
本立场文件认为,当前的心电图(ECG)表示学习基准测试过于狭隘且存在缺陷,通过证明适当的评估实践往往会显示随机编码器就能达到最先进预训练模型的水平,从而强调了将评估范围扩大到结构性心脏病和患者层面预测的紧迫性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能(AI)领域试图学习如何读取心电图(ECG)信号,就像一群学生正在为一场非常特定且高风险的考试做准备。多年来,每个人都在用同样的三本教科书(数据集名为 PTB-XL、CPSC2018 和 CSN)进行学习。这些教科书充满了关于心律失常(不规则心跳)和波形形状(那些波浪线长什么样)的问题。
这篇论文的作者 Zachary Berger 及其团队举手指出:“等等。我们给这些学生评分的方式出了问题,这让我们误判了谁才是真正的聪明人。”
以下是他们论点的拆解,使用了简单的类比:
1. “一刀切”的考试存在缺陷
目前,AI 社区使用一个叫做 Macro-AUROC 的单一分数来为这些模型评分。
- 类比: 想象一位老师在为一名参加了 100 道题测试的学生评分。其中 90 道题是关于“苹果”的,10 道题是关于“稀有异国水果”的。老师计算平均分,使得每道题的重要性都一样。
- 问题: 如果这个学生把所有的“苹果”题都答对了,但把“异国水果”题全答错了,他依然能得到一个不错的平均分。但在现实世界(医院)中,医生可能只关心那些“异国水果”(罕见心脏疾病)。通过将所有内容平均化,目前的系统掩盖了一个事实:该模型在真正重要的任务上可能表现得非常糟糕。
- 噪声: 此外,那些“异国水果”问题中,有些在整个测试中可能只有一两个例子。如果模型仅仅因为运气好或坏答对或答错了一个问题,就会导致整体成绩大幅上升或下降,使结果变得不可靠。
2. “惊喜”基准:随机猜测
在科学领域,你总是会将一项新的、高级的发明与一个简单、基础的版本进行对比,以观察这项发明是否真的增加了价值。
- 类比: 想象一场比赛,大家都在跑道上奔跑。那些高级的选手穿着高科技、预训练的鞋子(复杂的 AI 模型)。而“基准”选手穿着一双随机生成的、未经训练的鞋子(一个权重随机、尚未学习任何知识的模型)。
- 结果: 作者发现,在许多任务中,穿着随机鞋子的选手跑得和穿着高级鞋子的选手一样快。有时,随机选手甚至赢了!
- 启示: 这表明对于许多心脏任务而言,信号本身非常明显,你并不需要一个超级复杂的、经过预训练的大脑来寻找它。一个简单的、随机的起点通常就已经足够好了。这意味着那些“高级”模型可能并不像我们想象中那样特别。
3. 论文的处方:一份更好的教学大纲
作者认为,要解决这个问题,该领域需要改变测试模型的方式。他们提出了四条主要规则:
- 扩大课程范围: 不要只测试心律失常。心脏信号还包含关于结构性心脏病(如心肌无力)、血流动力学(血压和血流)以及未来患者预后(这个人一年内是否会生病?)的线索。目前的考试忽略了这些重要的课题。
- 停止隐藏细节: 不要只报告一个大的平均分,而是要报告针对每个特定任务的分数。如果一个模型擅长检测心脏病发作但极不擅长检测瓣膜问题,我们需要知道这一点,而不是只看到一个“75%”的平均值。
- 衡量不确定性: 因为某些心脏状况很罕见,结果可能会不稳定。作者说我们必须报告“置信区间”(一系列可能的得分范围)来展示我们的确定程度。如果范围很大,说明结果是不可靠的。
- “随机鞋”检查: 每当有人声称他们的新 AI 模型是最优的模型时,他们必须证明该模型能够击败“随机鞋”基准。如果它没有,那么这个高级模型实际上并没有发挥任何作用。
总结
这篇论文是一次行动号召。它指出,目前评估心脏信号 AI 的方式,就像仅根据学生背诵字母表的能力来评分,却忽略了他们写故事的能力。它揭示了许多“先进”的 AI 模型其实仅仅比随机猜测好一点点,我们需要开始在更广泛、更具临床相关性的任务集上测试它们,并采用更严格、更诚实的评分规则。
核心观点: 该领域需要停止追求狭隘测试中的高平均分,转而证明这些模型确实能够胜任医生所需的复杂、现实世界的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。