Hidden Errors in Big Data: The Case of Property Records
本文审计了主流的经纪房产数据集,并揭示了导致经济不平等和财产税累退性关键指标产生偏差的系统性误差与覆盖缺口,强调了对开放行政数据以及提高数据来源透明度的紧迫需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
全球最大数据图书馆中的隐形故障
想象一下,你正试图解开一个巨大的拼图,但你使用的不是真正的拼图块,而是别人制作的复印件的复印件。这就是“大数据”的世界。如今,科学家、政府,甚至运行我们城市的人工智能系统,都依赖于海量的信息来做出决策。他们利用这些数据来研究从如何治疗疾病到如何对你的房屋征税的一切问题。但问题在于:大部分数据并不是由科学家直接收集的。它是从“数据经纪人”(data brokers)那里买来的——这些公司从成千上万个不同的地方收集信息,将其进行清洗,然后作为整洁、即用型的数据包出售。
这篇论文提出的核心问题是:如果复印件错了怎么办?
当你购买一个数据集时,你是在信任那个经纪人完美地完成了他们的工作。但如果他们漏掉了一些碎片呢?如果他们抄错了一个数字呢?或者如果他们使用了一种奇怪的技巧来猜测缺失的数字,而那个技巧让整个画面看起来发生了扭曲呢?这就是所谓的“大数据悖论”:你拥有的数据越多,你就越感到自信,但如果这些数据有缺陷,你的自信其实是一个陷阱。你可能会得到一个非常精确但完全具有误导性的答案。本文深入探讨了这个问题的其中一个特定且高风险的领域:用于追踪房屋售价及应缴税额的数据。如果这些数据出了问题,可能意味着富人缴纳的税款比应缴的少,或者穷人缴纳的税款比应缴的多,而且在为时已晚之前,根本没有人会察觉到这一点。
伟大的房价劫案:当数据经纪人出错时
在这项研究中,作者扮演了数字侦探的角色,审计了美国两大“数据经纪人”:Cotality 和 ATTOM。这些公司是房地产领域的巨头;它们向银行、政府和研究人员出售有关数百万套房屋的信息。作者决定将他们的工作与“地面实况”(ground truth)进行对比——即伊利诺伊州库克县(包括芝加哥)政府保存的原始、官方记录。你可以把政府记录看作是商店提供的原始、带签名的收据,而经纪人的数据则是你从第三方应用中获得的副本。
侦探们发现,经纪人的副本远非完美。他们发现了两种正在破坏数学计算的主要错误类型:
1. “缺失碎片”问题(覆盖误差)
想象一下,你正在数篮子里的苹果,但做清单的人忘了写下 12% 到 15% 的苹果。这就是一个“覆盖误差”。作者发现,对于每 100 笔真实发生的房屋交易,经纪人大约漏掉了 12 到 15 笔。为什么?因为经纪人有时会对什么才算作“房屋”或“真实销售”产生混淆。他们可能不小心将房屋销售标记为“止赎”(foreclosure,这属于不同的类别),或者因为地址写法略有不同而完全遗漏了某次销售。这意味着数据不仅仅是有一点偏差,而是缺失了人口中的一大块,使得住房市场的图景变得不完整。
2. “猜谜游戏”问题(插补误差)
有时,经纪人并没有房屋的实际成交价。他们并没有说“我不知道”,而是尝试用一种数学技巧来猜测价格。他们查看“转让税”(房屋出售时支付的一小笔费用),并尝试通过倒推来确定价格。但问题就在这里:不同的城镇有不同的税率。如果经纪人猜错了城镇的税率,他们的计算就会出现巨大偏差。
作者发现,在他们检查的房屋销售中,大约有 1% 到 2% 的案例中,经纪人的价格与实际价格大相径庭——有时甚至相差数十万美元!更奇怪的是,这些错误并非随机产生的。经纪人经常在完全相同的房屋上犯下完全相同的错误。例如,如果一套房子以 30 万美元的价格售出,经纪人可能会错误地将其记录为 2 万美元(实际价格的三分之二)或 60 万美元(实际价格的两倍)。这就像一台不断重复按错数字的盖章机。
多米诺骨牌效应:为什么这与你的钱包有关
你可能会想:“所以,只是有几套房子的价格错了,谁会在乎呢?”作者展示了为什么这很重要,因为这些数字被用来计算所谓的财产税累退性(property tax regressivity)。
把财产税想象成一场小组聚餐,每个人都应该根据自己的点餐情况支付份额。“累退性”是一个高级词汇,指的是那些点了便宜餐食的人,最终支付了比点牛排的人更高比例的账单。在现实世界中,研究通常表明,贫困社区的实际税率往往高于富裕社区。
作者利用经纪人的数据来计算这种税收公平性。结果如何?经纪人的数据给出了与真实政府数据完全不同的答案。
- Cotality 的数据让税收制度看起来比实际情况更公平(低估了不公平程度)。
- ATTOM 的数据让税收制度看起来比实际情况更不公平(高估了不公平程度)。
由于经纪人的数据存在这些隐藏的错误,关于谁在支付多少钱的“真相”会根据你购买的数据不同而发生剧烈偏移。如果政府官员使用了错误的数据,他们可能会认为税收制度运行良好,而实际上它正在伤害贫困家庭;反之亦然。
“复制粘贴”阴谋
最令人惊讶的发现之一是,两大经纪人 Cotally 和 ATTOM 犯了同样的错误。他们遗漏了相同的房屋,并在相同的交易中犯了同样的奇怪数学错误。事实证明,这些公司经常互相共享数据。这就像两家新闻台都从同一个通讯社获取突发新闻,而那个通讯社出了个错别字。两家新闻台都会报道同一个错误的故事,而且没有人会意识到这是一个错误,因为双方都达成了一致。
作者发现,对于那些经纪人弄错价格的房屋,99.8% 的情况下,两家经纪人拥有的错误数字是完全相同的。这对科学家来说是一个大问题。通常,如果两个不同的来源达成一致,你会认为:“太好了,这一定是真的!”但在这种情况下,他们的共识其实是一个陷阱。他们因为同样的原因而犯错。
底线
本文不仅仅是指出了几个打字错误;它揭示了我们理解经济方式的基础性裂痕。作者得出结论,我们不能盲目信任经纪人出售的那些“整洁的数据包”。由于这些公司并不总是告诉我们他们是如何清洗或猜测数字的,我们实际上是在盲目飞行。
解决方案是什么?我们需要开放数据。政府已经拥有了原始的、正确的记录(即“地面实况”)。作者认为,与其依赖昂贵、不透明的经纪人,研究人员和政策制定者应该直接使用免费的公共数据。如果我们看不清数据是如何生成的,我们就无法信任从中得出的结论。在一个人工智能和大数据主导的世界里,我们能做的最重要的事情,就是确保数据不仅规模宏大,而且也是正确的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。