Position: AI for Science Should Treat Measurement-to-Dataset Pipelines as Inference Components
本文主张,面向科学的 AI 工作流必须将“从测量到数据集”的流水线视为主动推理组件,而非固定数据源,以应对隐藏假设空间、未认证的迁移性以及不受控的多样性,从而实现流水线充分性的可量化评估与可复现的科学证据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《AI for Science 应将“测量到数据集”的流水线视为推理组件》的通俗化解读,辅以富有创意的类比。
核心理念:“冻结透镜”问题
想象你试图在黑暗的房间里理解一个神秘的物体。你无法直接看到物体本身,只能看到它被特定灯光投射在墙上的影子。
在AI for Science(科学人工智能)领域,研究人员往往表现得像是在研究物体本身。但事实上,他们研究的只是影子。
该论文指出,在许多科学领域(如脑成像、天文学或药物发现),科学家所使用的数据并非“原始现实”。它是经过处理、清洗和重建后的现实版本。这种处理是通过一个称为流水线(pipeline)的长链条步骤完成的(包括过滤噪声、填补缺失部分、转换信号等)。
目前,科学家们将最终数据集视为固定、客观的事实。他们会说:“这是数据,现在让我们构建模型吧。”作者将这种做法称为**“冻结透镜”**。他们认为这是一个错误。生成数据的流水线实际上是科学推理的重要组成部分,而通过“冻结”它(即忽略它),我们掩盖了一个事实:我们的结论完全取决于我们选择如何投射那个影子。
导致出错的三种方式
作者指出了这种“冻结透镜”导致科学失败的三种具体方式。可以将它们视为三个陷阱:
1. 隐藏菜单(隐藏假设空间)
类比:想象一家餐厅给你端来一个汉堡。你假设这个汉堡就是厨师所做之事的“真相”。但厨师其实有 50 种制作该汉堡的方法(不同的面包、不同的烹饪时间、不同的酱料)。餐厅只给你端上了其中一种特定版本,却未告知你还有另外 49 种。
问题:当科学家发布数据集时,他们通常只选择一种方式来处理原始测量数据。他们不会告诉你,如果他们选择了稍微不同的过滤器或不同的清洗方法,这个“汉堡”(数据)可能会看起来完全不同。
结果:AI 模型基于那一种特定版本的汉堡进行学习。它认为自己发现了一个普遍真理,但实际上它只是在死记硬背那一种特定配方的怪癖。其他可能现实的“菜单”被隐藏了起来。
2. 破碎的地图(未认证的迁移性)
类比:想象你有一张为晴天完美绘制的城市地图。你利用这张地图导航。但随后天开始下雨,街道被淹没。这张地图没有显示水坑,因为它只是为晴天绘制的。你试图在雨中使用这张地图,结果被困住,并责怪自己的驾驶技术。
问题:流水线在收集数据的实验室(“晴天”)中可能表现极佳。但是,如果你尝试将相同的数据处理方法应用于来自不同医院、不同国家或不同机器的数据(“雨天”),流水线可能会失效,或以奇怪的方式扭曲数据。
结果:科学家往往不知道他们数据处理方法在何时停止有效。当 AI 模型在新数据上失败时,我们不知道是 AI 不好,还是“地图”(流水线)对于那个新环境本身就是无效的。
3. 专家人群(未受管制的多样性)
类比:想象一个由 100 位专家组成的陪审团,看着同一张犯罪现场照片。他们都同意事实,但每个人都使用了略有不同的放大镜。其中 90 人认定嫌疑人有罪,10 人认定嫌疑人无罪。新闻报道称:“专家认定嫌疑人有罪”,忽略了那 10 位持反对意见的人。
问题:在科学中,通常存在许多“可辩护”的数据处理方式。你可以用五种不同的有效方式来过滤噪声。如果你选择一种,会得到一个结果;如果你选择另一种,会得到不同的结果。
结果:科学家通常选择能给他们带来“最酷”或最显著结果的那一种方法,而忽略了另外 99 种有效方法会给出不同答案的事实。他们将单一选择视为绝对真理,而不是承认:“我们尝试了 100 种方法,答案有点不稳定。”
"EEG 审计”:现实检验
为了证明这不仅仅是理论,作者在有关抑郁症的脑电波(EEG)数据上进行了一项大规模实验。
- 设置:他们获取原始脑电波数据,并将其通过245,376种不同的处理流水线组合进行运行。(想象尝试过滤器、清洗工具和测量规则的所有可能组合)。
- 目标:他们正在寻找一个特定的信号:抑郁症患者与健康人群之间脑活动的差异。
- 惊人的结果:
- 245,000 多种流水线中的许多都发现了“显著”差异。
- 但是,当他们检查这些差异是否在不同人群(不同数据集)中成立时,在 245,376 种流水线中,只有 1 种幸存下来。
- 这意味着生存率仅为0.0004%。
这意味着什么:几乎每次科学家在该领域发现“新发现”时,很可能只是碰巧选择了特定流水线的偶然结果。“真相”是如此脆弱,以至于稍微改变处理规则,发现就会消失。
解决方案:“可计算观测框架”
作者并非主张停止科学研究。他们主张我们需要改变对待数据的方式。
当前方式:
- 原始数据 [黑盒流水线] “清洗后的数据” AI 模型。
- 我们假装“清洗后的数据”就是真相。
提议的方式:
- 原始数据 作为变量的流水线 AI 模型。
- 我们将流水线视为科学假设。我们要问:“如果我们改变流水线,这个结论是否依然成立?”
他们提议建立一个系统,其中:
- 流水线是“可执行对象”:不再仅仅是一份写着“我们使用了方法 A"的 PDF 报告,而是将方法 A 的代码(及其所有可能的变体)保存为数字对象,以便运行、测试和修改。
- 稳定性是目标:我们不再仅仅寻找预测效果最好的模型,而是寻找无论使用哪种有效流水线都能给出相同答案的模型。
- 不确定性被共享:如果 100 种流水线给出了 100 个不同的答案,我们就报告这种不确定性。我们不将其隐藏。
总结
该论文认为,在 AI for Science 中,用于测量现实的工具与测量本身同样重要。通过忽略工具(流水线),科学家往往在 shaky 的基础上构建 AI 模型。他们需要停止将处理后的数据视为固定事实,并开始将其视为科学实验中的可变部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。