← 最新论文
🤖 machine learning

Auditing Recorded Predictive Lead Service-Line Classifications Against Physical Verification: A Statewide Study of New York

这项针对纽约州的 statewide 研究表明,尽管大多数公用事业部门的预测性服务管线模型与实地验证结果一致,但纽约市的系统显示出统计学上的显著差异,即在近 121,000 个地址经实地挖掘确认存在铅管的情况下,模型却将超过 43,000 个地址归类为“已知其他”,同时还有证据表明,部分公共侧的判定错误地复制了客户侧的模型输出。

原作者: Muhammad Sarmad Sohail

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Sarmad Sohail

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在美国,一项名为《铅与铜规则修订案》(Lead and Copper Rule Revisions)的联邦规则要求每个社区供水系统必须创建一份完整的服务管线地图,即从街道输送到各个家庭的水管。其目标是寻找并更换由铅制成的管道,铅是一种会导致严重健康问题的有毒金属,对儿童的影响尤为严重。几十年来,公用事业部门通过旧纸质记录或通过挖掘来了解铅管的位置。但对于数百万份没有记录的地址,新规允许水务公司使用计算机模型来推测管道材质,而不是进行挖掘。这些模型通过分析房屋年龄和社区等数据,来预测管道更有可能是铅、铜还是塑料。这样做的初衷是为了节省成本和时间,因为挖掘每一根管道的费用极其高昂。然而,由于这些模型本质上是猜测,规则要求公用事业部门必须通过对分类管道进行实地检查,来验证其准确性。公众利益的关键在于:这些计算机猜测是否可靠到足以托付于公共健康,或者它们是否在统计置信度的外壳下隐藏了大量危险的铅管。

研究人员穆罕默德·萨尔马德·索海尔(Muhammad Sarmad Sohail)决定通过查看纽约州水务公司提交的公开记录来测试这一系统。纽约州的情况很特殊,因为它为每一个地址都发布了详细的清单,展示了公用事业部门是如何确定管道材质的:是通过挖掘、查阅纸质记录,还是使用了计算机模型。索海尔并没有试图证明计算机模型在普遍意义上是错误的;相反,他观察了纽约州水务公司提交的具体数字,以查看其是否合乎逻辑。他重点研究了纽约州 153 个至少为 100 个地址使用这些计算机模型的地区。他的第一步是一个简单的检查:他统计了模型给出了多少种不同的答案。在一个健康的系统中,模型应该有时说“铅”,有时说“铜”,有时说“未知”,具体取决于特定的房屋。但在 75 个这样的地区(涵盖近 126,000 个地址),模型对每一户人家都只给出了同一个答案。这就像一名天气预报员无论季节和地点如何,都预报每一天都会下雨一样。

这种缺乏多样性的现象并不一定意味着欺诈,但它是一个警示信号,表明情况出了问题。索海尔随后将这些“单一答案”清单与同一水务部门在相同城镇进行的实地检查进行了对比。在大多数情况下,模型给出的单一答案与工人在地下发现的情况相符。然而,在七个特定的地方,模型的单一答案与工人的观察结果直接矛盾。最引人注目的例子是纽约市。该市使用计算机模型对 43,215 个地址进行了分类。对于其中的每一个地址,模型都将其标注为“已知其他”(Known Other),这个类别意味着管道肯定不是铅,尽管具体的材质尚不明确。纽约市曾在其他地方通过不同方法发现了数千根铅管,并且在另外 12 万多个地址中使用了“未知”类别。然而,对于这组包含 43,000 户家庭的庞大群体,模型从未暗示过其中可能存在铅管,甚至从未出现过“未知”的情况。这是一个完美的、连续不断的“非铅”记录,而这组房屋中包含了许多建于 1940 年之前的建筑,而在那个时期,铅管非常普遍。

这种矛盾并非统计学上的偶然,而是得到了该市自身工人的证实。在纽约市五个行政区内,工人已经实地挖掘并检查了数万根管道,发现了大量的铅管。如果计算机模型运行正常,它理应将这 43,000 个地址中的一部分标记为潜在的铅管。然而,它却将它们全部排除在外。同样的奇怪模式出现在距离 550 公里外的东罗切斯特(East Rochester),那是一个拥有完全不同水务公司的村庄。在那里,该模型也为每一户分类的房屋都给出了单一的“非铅”答案,尽管该村的工人在挖掘管道时发现近 10% 的管道含有铅。研究人员还发现,该市关于这些管道的公开记录并非独立创建。数据显示,该市只是简单地将针对客户侧管道的计算机猜测,复制到了属于城市的公共侧管道上,即便公共侧管道是另一根由城市拥有的不同管道。这表明,该判定并非经过新鲜分析的结果,而是一个复制粘贴错误,抹去了模型原本可能存在的任何不确定性。

为了了解这 43,215 个地址中可能隐藏了多少铅管,研究人员观察了建筑物的年龄。该模型主要应用于较新的房屋,而这类房屋自然铅管较少。然而,即使在根据建筑物年龄进行了调整后,数据依然无法对上。在其他方法发现铅管的旧建筑中,该模型却一无所获。通过以同一社区的实地检查结果作为参考,研究人员估计,在 43,215 个地址中,可能有 1,150 到 1,450 个地址的铅管被错误地标记为了安全。这一估算依赖于“挖掘管道的工人不存在偏见”的假设,但即便考虑到这种不确定性,模型那完美的记录与现实情况之间的差距也大到无法忽视。

这项研究并非声称计算机模型永远无法奏效,也不是说每家公用事业部门都在失职。研究发现,在许多地方,模型产生的多种答案与物理现实是相符的。问题在于这些数据在七个特定地点是如何被报告的。研究人员认为,问题不在于计算机代码本身,而在于数据在发布前是如何处理的。很有可能模型确实产生了一系列不同的答案,但在向州政府备案之前,某个计算机程序或人工流程过滤掉了所有非“明确安全”的结果。这意味着公开记录展示了一个干净、确定的列表,从而掩盖了模型实际存在的各种不确定性。州政府的规则要求公用事业部门提供置信区间(即衡量其确定程度的指标)并制定检查计划。然而,这些公用事业部门提交的记录中完全没有体现出这些内容。

这次审计之所以成为可能,是因为纽约州会公布每个地址所使用的检测方法。在其他大多数州,公众并不知道一个管道分类是来自铁锹还是来自电子表格。研究人员建议,要求在全国范围内实现这种细致程度的透明度将不会产生额外成本,同时也能让任何人都能检查公用事业部门是否在利用单一且不变的答案来掩盖不确定性。研究结果发出警告:当一个模型在成千上万个家庭中产生一个完美且一成不变的结果时,这往往不是因为模型完美,而是因为整个过程已经失去了观察真相的能力。数据显示,在最大的案例中,该备案并未达到州政府为使用该特定标签所设定的条件。研究人员总结道,清单应当记录模型的“不确定性”,而不应仅仅记录其最终的“猜测”,监管机构应当将没有任何变化的列表视为需要立即调查的红旗信号。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →