Do not log(x+1) transform: the bias and alternatives
本文认为,广泛使用的 转换引入了显著的偏差和误导性的推断,特别是对于指数分布的数据,并建议放弃该方法,转而采用广义线性模型(GLM)等替代数值方法。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在自然界中,测量值的表现方式往往违背了简单的直线规律。当科学家统计池塘中的鱼类数量、测量森林冠层的垂直高度或追踪海洋温度时,数据很少会均匀分布。相反,小数值很常见,而大数值则很罕见,从而形成一种不对称的形状,使得标准的数学工具难以寻找规律。为了解决这个问题,研究人员长期以来一直依赖一种被称为对数变换的数学技巧。这个过程通过压缩巨大的数字并拉伸微小的数字,将数据重新塑形,把崎岖不平、不均匀的景观变成一片平滑、平坦的平原,使其中的关系变得清晰且易于研究。然而,当数据中包含零时,这个技巧会撞上一堵硬墙。由于数学运算无法处理零,科学家们传统上会在应用该技巧之前,向每一个测量值中加入一个微小的、任意的数值。几十年来,最常见的选择是简单地在每个数值上加 1,这种方法被称为 log(x+1) 变换。它看起来像是一个无害且实用的变通方案,让研究人员能够在不丢弃宝贵信息的情况下,将零计数纳入研究。
来自葡萄牙和阿尔加维大学的研究小组现在已经证明,这种长期的习惯存在根本性的缺陷。通过使用计算机生成的数字和真实的生态数据进行测试,他们证明了向数据中添加常数并不只是解决了零的问题,它实际上扭曲了真相。研究表明,这种简单的加法引入了巨大的偏差,扭曲了变量之间的关系,并导致科学家对自然运作方式得出错误的结论。研究人员发现,这种扭曲并非微小的瑕疵,而是一个严重的错误,它改变了关系的斜率,掩盖了数据的真实分布,甚至可以反转趋势的方向。他们的工作表明,科学界需要立即停止使用这种特定的修复方法,并寻找更稳健的方法,而不是依赖于向数据中添加任意数字。
为了证明他们的观点,研究人员首先创建了一个完美的、人工生成的数据集,其中两个变量之间的关系是完全已知的。他们设计了一个场景,其中一个变量根据另一个变量呈指数级增长(这是自然界中常见的模式),但他们加入了几个零值以模拟现实世界的情况。当他们对这些完美数据应用标准的 log(x+1) 变换时,得到的模型极其不准确。原本应该是平滑且可预测的曲线变得弯曲且破碎。研究人员发现,数字“1”的选择是罪魁祸首。因为在自然界常见的微小数值面前,“1”是一个巨大的数字,加上它会完全掩盖实际的数据。对于极小的测量值,增加的“1”成为了主导因素,使得微小的差异消失殆尽。对于较大的测量值,这种增加产生了不同的影响,造成了数学模型无法修正的失配。即使研究人员尝试使用比 1 小得多的数字代替,问题依然存在。如果他们选择的数字太小,数据中的零会被转化为与其余数据相距甚远的数值,从而导致分析偏离轨道。
随后,该团队超越了人工数字,开始检查真实的生态研究,包括一项关于海草开花的研究和另一项关于葡萄牙河口水质的研究。在海草研究中,研究人员试图理解上升的海水温度是如何触发大规模开花的。热量与开花之间的关系显然是非线性的,随着热量的增加而加速增长。当原始研究人员使用 log(x+1) 方法分析此数据时,得到的曲线未能捕捉到反应的真实强度。它平滑了峰值,并错过了爆发式的快速增长。相比之下,当新团队使用不涉及添加常数的方法重新分析相同的数据时,热量与开花之间那种真实的、剧烈的关系清晰地显现了出来。同样,在河口研究中,科学家们观察了地上部分与地下部分植物生物量的比例,以确定海草的健康状况。由于有些植物在生长,而另一些在萎缩,数据中包含了大于 1 和小于 1 的数值。log(x+1) 方法对这些数值的处理是不均衡的:它压缩了健康的生长植物,却夸大了挣扎中的植物,这导致了对生态系统健康状况的扭曲视图。研究人员表明,这种扭曲不仅仅是一个统计学上的奇趣现象,它改变了关于海草是在繁荣还是在衰亡的解读。
研究还测试了其他常见的数学技巧是否能解决这个问题。他们尝试了平方根、立方根以及其他常用于平滑不均匀数据的复杂调整。虽然其中一些替代方案在特定情况下比 log(x+1) 方法效果更好,但当数据包含零且遵循指数模式时,没有一种方法能完全解决问题。研究人员发现,当数据以指数方式表现时,任何通过简单公式对数字进行重塑的尝试,都无法在不引入误差的情况下使其符合标准的线性模型。然而,他们也澄清说,这并不意味着每种变换都注定失败;对于不严格遵循指数模型的数据集,诸如 Box-Cox 变换等其他方法是可以成功的。在这些特定的指数案例中,论文结论指出,最好的解决方案不是强行将数据拟合为直线,而是应该使用专门针对非线性数据设计的统计模型,例如广义线性模型,这类模型可以直接处理零值和指数增长,而无需添加任意数字。
这一发现的意义在环境科学领域非常重大,因为那里的数据经常包含零,例如某个物种在某处缺失,或者某种污染物无法被检测到。多年来,log(x+1) 变换一直是处理这些零值的默认工具,被广泛应用于无数关于生物多样性、气候变化和污染的研究中。研究人员认为,这种广泛的使用很可能导致了大量研究产生了偏差的结果,即关系的强度被低估或高估,或者趋势的方向被误解。这种偏差并非细微,它大到足以改变研究的结果。作者强调,虽然 log(x+1) 方法易于使用,但它并不是一种有效的科学解决方案。他们敦促科学界放弃这种做法,并采用更严谨的方法来尊重数据的真实本质。通过这样做,研究人员可以确保他们关于自然界的结论是基于现实,而非基于一个便捷但有缺陷的快捷方式所产生的数学人工制品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。