A Kolmogorov-Smirnov-Type Test for Dependently Double-Truncated Data
本文针对双截断寿命数据的参数分布族提出了一种 Kolmogorov-Smirnov 型检验,利用 Copula 模型来解释相关性,并通过模拟实验以及对德国企业寿命的应用展示了其有效性,该应用拒绝了年龄同质性闭合风险率的假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
失踪时间的谜团
想象你是一名侦探,正试图弄清楚某种特定类型的物体通常能维持多久。也许是灯泡、智能手机,甚至是某家企业。在统计学世界中,这被称为研究“寿命”(lifespans)。但问题在于:你不能仅仅等待每一个物体都“死亡”后才去观察它活了多久。你必须观察一个时间切片。
这就是“截断”(truncation)介入的地方。把它想象成一台相机,只能拍摄已经在特定房间里的人。如果你只拍摄目前正在候诊室里的人,你就会错过那些还没到达的人(左截断)以及那些已经离开的人(右截断)。在现实生活中,这种情况经常发生。例如,如果你研究的是在2014年倒闭的企业,你只能看到那些在2014年时已经足够“年长”而得以存续的企业。你会错过那些在2015年才开始的企业,也会错过那些在2010年就倒闭的企业。
通常情况下,统计学家假设事物的“起始时间”与它的“持续时长”无关。他们假设一家成立于1990年的企业与一家成立于2010年的企业,倒闭的可能性是一样的。但在现实世界中,事情很少如此简单。预期寿命会随时间变化,而且开始某个事业的“年龄”实际上可能会影响其生存时长。本文探讨了一个棘手的问题:当起始时间和结束时间秘密地联系在一起(就像两个始终同步舞动的舞者)时,如何测试一个寿命是否遵循某种可预测的模式。
双重截断数据的舞步
来自罗斯托克大学的统计学家 Anne-Marie Toparkus 和 Rafael Weißbach 决定构建一种新工具来解决这个舞池之谜。他们创建了一种“Kolmogorov-Smirnov 型检验”,这是一种高级说法,意思是我们制造了一把超级灵敏的尺子,用来衡量一个理论假设与混乱的现实数据之间的契合程度。
他们的主要任务是测试一个特定的假设:企业的寿命是否遵循“指数分布”(exponential distribution)?用通俗的话说,指数分布意味着事物关闭/倒闭的风险是恒定的。这就像一个放射性原子:无论它有多老,它在下一秒衰变的概率始终保持不变。如果这对企业成立,这意味着一家成立20年的公司在明天倒闭的可能性,与一家成立1年的公司是一样的。
然而,作者怀疑这并非事实的全貌。他们知道,在现实世界中,“截断年龄”(研究开始的时间)与“寿命”(企业持续的时间)往往是相互依赖的。为了模拟这种联系,他们使用了一种名为“连接函数”(copula)的数学工具,具体来说是 Farlie-Gumbel-Morgenstern (FGM) 连接函数。你可以将连接函数想象成一种胶水,它能将两个独立的概率曲线粘在一起,让它们能够同步摆动。FGM 连接函数的特殊之处在于,无论它们是同向运动还是反向运动,它都能将它们粘合在一起。
德国企业实验
为了测试这个新尺子的性能,作者查看了一个庞大的数据集:55,279 家德国企业。这些企业成立于1990年至2013年之间,研究观察了哪些企业在2014年至2016年期间关闭。由于数据仅包含在2014年仍然存续但在2016年前已关闭的企业,因此该数据是“双重截断”的——在开头和结尾都被切掉了。
研究人员运行了两次测试。首先,他们假设起始日期和寿命是完全独立的(“简单版”);然后,他们再次运行测试,利用 FGM 连接函数来解释为何较老的公司可能表现得与较新的公司不同。
结论:时钟并非恒定
结果是清晰且具有决定性的。当作者将数据与“指数分布”(即关闭风险随时间恒定的观点)进行比较时,检验统计量非常大。事实上,它远远超过了通过模拟计算出的临界值。
论文明确拒绝了“德国企业寿命遵循具有恒定风险率的指数分布”这一假设。换句话说,数据证明了企业关闭的风险在不同年龄阶段是不一样的。“年龄同质化关闭风险”(即认为年龄不重要的观点)显然是错误的。
作者还发现,起始日期与寿命之间的依赖关系是真实存在的。他们计算出 Kendall's tau 大约为 0.023,这听起来很小,但论文确认这是具有统计学意义的。这种正向依赖关系表明存在负向时间趋势:随着时间的推移,这些企业的预期寿命实际上在下降。
他们是如何做到的(幕后的魔术)
你可能会好奇他们是如何如此精确地计算出这些结果的。作者并非凭空猜测;他们构建了一个严密的数学引擎。他们使用了被称为“泛函 Delta 方法”(functional delta method)和“Donsker 类论证”(Donsker-class arguments)的方法。如果这听起来像天书,请将其想象成一种处理方法,用于应对数据并非完美的平滑曲线,而是由5.5万个独立点组成的锯齿状、凹凸不平的杂乱集合。
他们开发了一种算法(算法 1),可以通过检查图表上的特定“交点”和“投影”来处理数据。通过这种聪明的数学方法,他们证明了无需检查每一个可能的时间点(那会耗费大量时间),只需要检查有限的几个位置,就能找到理论假设与现实之间最大的差异。
为了确定他们的结果是真的具有显著性还是仅仅是巧合,他们必须模拟“临界值”。由于对于这种复杂的、具有依赖性的数据不存在简单的公式,他们运行了 1,000 次计算机模拟,生成随机的“布朗桥”(一种类型的随机游走),以观察如果指数分布假设成立,检验统计量应该呈现出怎样的状态。真实的数据远在这些模拟范围之外,因此这种拒绝是无可辩驳的。
总结
这篇论文不仅仅是在说“我们发现了一个模式”。它是在说:“我们从数学上证明了,关于德国企业倒闭风险恒定的简单想法是错误的。”作者认为,这种拒绝的原因很可能是由于商业环境随时间的变化,而非仅仅是企业成立时间的随机分布。
虽然本文的重点是德国企业,但他们构建的工具为统计学家提供了一种强大的新方法,用于测试任何起始时间和结束时间相互关联的寿命数据。它提醒我们,在数据世界中,事物很少是独立的,有时,理解未来的最佳方式是承认过去与现在正翩翩起舞。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。