The impact of data missingness mechanisms and degradation levels on rainfall agroclimatic data analyses
本研究利用蒙特卡洛模拟证明,非随机缺失(MNAR)机制和较高的缺失量(高达20%)会显著偏置农业气候降水指数,其中最大连续干旱日数(CDD)表现出最强的敏感性,且与湿润地区相比,干燥地区受到的影响较小。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图烤出一个完美的蛋糕,但你手头的食谱却缺了几页。如果你靠猜测缺失的配料,你可能会做出美味的甜点,也可能做出一个硬邦邦的砖头。这正是研究天气和农业的科学家们每天面临的现实。他们依赖“降雨数据”——一份关于每天降雨量的长期、连续的日记——来预测农作物何时生长、干旱何时可能袭来,以及如何喂养数百万人。但在现实世界中,这些天气日记经常是残缺不全的。观测站损坏、电池耗尽,或者风暴摧毁了设备,导致记录中出现了巨大的空白。核心问题在于:数据丢失的方式是否重要?如果缺失的天数只是随机发生的意外,这与那些专门发生在强风暴期间的缺失天数有什么不同吗?如果我们尝试用数学方法填补这些空白,我们的“蛋糕”味道还会对吗,还是整个配方会彻底崩溃?
这项由来自津巴布韦的研究人员开展的研究,通过将降雨数据视为一场“填空游戏”,深入探讨了这个棘手的问题。他们拿了一份完美、完整的降雨记录,并故意在其中撕开漏洞,以观察会发生什么。他们测试了数据丢失的三种不同方式:“完全随机缺失”(就像书中的一页随机掉落)、“随机缺失”(缺失的数据取决于已观测到的数值,而非缺失值本身)以及“非随机缺失”(最糟糕的情况,即缺失的页面恰恰是那些包含最重要降雨量的页面,比如强风暴)。他们还测试了当移除 5%、10% 或 20% 的数据时,情况会变得多么糟糕。
研究人员并没有仅仅靠猜测;他们运行了一个大规模的计算机模拟(一次“蒙特卡洛”实验)超过 2,000 次,以观察这些缺失的部分如何干扰五项特定的天气测量指标:最长连续降水天数(降雨量至少为 3mm 的天数)、最长连续干旱天数(降雨量少于 3mm 的天数)、季节总降水量、雨季开始时间以及雨季结束时间。他们发现,数据的消失方式有着巨大的影响。当数据是“非随机缺失”(隐藏了强降雨)时,结果的偏差最大,造成的误差也最严重。令人惊讶的是,关于季节开始和结束时间的测量指标非常顽强;即使数据缺失,它们也基本保持准确。然而,最长连续干旱天数的测量指标却完全失控了。在干旱地区,即使是少量的缺失数据也会使干旱期的计算变得混乱,有时甚至会让结果产生接近 100% 的偏差。
研究还揭示了一个有趣的转折:降雨量较多的湿润地区在数据缺失时,其总降水量会出现更大的误差,仅仅是因为那里有更多的“东西”会丢失。但在该国最干旱的部分,总降水量数值保持得相当稳定,因为原本就没有多少降雨。然而,那些干旱地区付出了另一种代价:它们追踪干旱期的能力完全崩溃了。研究人员得出结论,虽然我们无法阻止天气观测站损坏,但我们需要非常谨慎地处理如何填补空白。如果我们假设缺失的数据是随机的,而实际上它隐藏了风暴,那么我们对农民的预测可能会出现危险的错误,从而可能导致规划不周和减产。这项研究表明,保持我们的天气仪器正常运转才是最好的“配方”,因为没有任何数学方法可以完美修复一本残缺的日记。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。