Modeling and estimating skewed and heavy-tailed populations via unsupervised mixture models
本文介绍了一种全无监督混合模型,该模型结合了用于主体部分的对数正态分布和用于尾部的零位置广义帕累托分布,旨在无需进行阈值选择的情况下有效建模非负重尾数据,并通过 EM 算法和一个 R 程序包为现有方法提供了一种易于估计的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图根据身高来描述一群人。大多数人身高适中,在房间中间形成了一个漂亮的、平滑的小山丘。但随后,你发现有几个巨人站在后排,高高在上,俯视着所有人。
在数据世界中——比如保险理赔、城市规模或篮球得分——这种“带有巨人的小山丘”是一个非常普遍的问题。中间部分(“主体”)通常遵循可预测的模式,但那些巨人(“尾部”)既巨大又罕见,以至于打破了规则。如果你试图用一个单一的数学公式来描述整个群体,通常会失败。你要么完美地拟合了普通人,却忽略了巨人;要么拟合了巨人,却让普通人看起来很奇怪。
多年来,统计学家一直试图通过将两个不同的公式“拼接”在一起来解决这个问题:一个用于主体,另一个用于尾部。但这就像是将两块不同的布料缝合在一起。你必须选择一个特定的位置进行切割和粘贴,并且必须确保边缘完美匹配,以免出现凸起。这个“切割点”(称为阈值)是一个令人头疼的问题,有时数学过程会变得如此复杂,以至于你甚至无法轻松地计算出答案。
新的“神奇混合法”
来自特伦托大学的研究人员 Marco Bee 和 Flavio Santi 提出了一种看待这群人的新方法。他们建议不要像缝合两块布料那样,而是像混合油漆一样将它们混合在一起。
他们称之为静态对数正态-广义帕累托分布(GPD)混合模型。以下是它的工作原理:
- 主体油漆: 他们使用“对数正态”(Lognormal)公式,这种公式非常擅长描述日常的平均数据(即那个小山丘)。
- 巨人油漆: 他们使用“广义帕累托分布”(GPD),这是一种专门为处理大规模、罕见异常值而设计的特殊公式。
- 搅拌勺: 他们没有进行切割和粘贴。相反,他们说:“让我们把这两种油漆混合在一起。”一部分数据来自对数正态油漆,剩下的则来自 GPD 油漆。
最棒的部分在于:没有切割点。 该模型是“无监督”的,这意味着你不需要去猜测普通人在哪里结束,以及巨人们从哪里开始。转换过程是平滑的,就像一种渐变,而不是一个锯齿状的接缝。
他们如何测试它
作者不仅仅是猜测这行得通;他们运行了大量的计算机模拟,以观察其表现如何。
- “正确”测试: 他们创建了完美符合这种新混合模型特征的虚构数据。当他们尝试找回其中的成分时,该方法表现得非常出色,尤其是在拥有大量数据(500 个观测值或更多)的情况下。
- “错误”测试: 他们尝试将这种新模型拟合到由其他更复杂方法生成的数据上。即使数据不是由他们的特定配方生成的,他们的模型依然拟合得惊人地好。事实上,在一次使用“广义贝塔分布”的测试中,他们的模型比另外两个领先的竞争对手拟合得更好。
- 速度测试: 他们比较了计算答案所需的时间。由于该方法比“动态混合法”(另一种流行的方法)快得多,但比最简单的“拼接法”稍慢。不过,作者指出,由于不需要解决那些不可能的数学难题,他们的处理方式要容易得多。
现实世界的证明
为了看看这在现实世界中是否有效,作者在两个非常混乱的数据集上测试了它:
- 汽车保险理赔: 他们研究了来自一家美国保险公司的 6,773 份汽车保险理赔数据。数据呈现偏态分布,既有很多小额理赔,也有一些巨额理赔。他们的混合模型完美地拟合了数据,而传统的单公式方法(仅使用对数正态或仅使用 GPD)则无法捕捉到全貌。
- 银行欺诈: 他们分析了一家意大利银行的内部欺诈损失。同样,数据非常狂野且具有重尾特征。混合模型是唯一一个通过了“拟合优度”测试的模型,这意味着它是唯一一个真正看起来符合真实数据的模型。
他们的发现(以及没能发现的)
主要结论是,这种“神奇混合法”是一种灵活、可靠且易于使用的工具,用于建模偏态、重尾数据。它表明,你可以获得与更复杂的、难以处理的方法相同的准确度,但却能减少计算上的麻烦。
然而,作者也非常谨慎,没有过度吹捧。他们指出,当样本量较小(例如 100 个观测值)时,数学计算可能会变得有些不稳定,对模型中“巨人”部分的估计可能会有较大的波动。他们还提到,虽然该模型对于拟合数据和计算风险(如风险价值 VaR)非常出色,但它并不是主要为了对人群进行分类而设计的,尽管数学计算确实可以暗示哪些数据点更有可能由哪种“油漆”产生。
底线
本文表明,对于任何处理具有长尾极端值数据(如保险损失或金融风险)的人来说,这种新的混合模型都是一个强有力的竞争者。它提供了一种平滑的、无需阈值的方案,可以对从平均水平到极端水平的整个群体进行建模,而无需为寻找完美的切割点而头疼。它不是一个能瞬间解决所有问题的魔杖,但它是一个比目前市面上现有的工具更稳健、更快且更灵活的工具。
所有这些方法都可以通过名为 lognGPD 的免费 R 包获取,因此任何人都可以尝试混合自己的“油漆”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。