← 最新论文
📊 statistics

Model selection with proper scoring rules on data sets of time series

本文研究了得分分布的偏斜如何导致均值、中位数和基于秩次的统计量在时间序列数据上产生冲突的模型选择结果,并证明了尽管这些准则在大规模测试集下会趋于一致,但均值得分在识别短测试集上的真实模型方面具有独特的可靠性,这一点已在包括 M5 竞赛在内的间歇性时间序列分析中得到了证实。

原作者: Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名教练,正试图为你的球队挑选最优秀的球员。你拥有一个庞大的球员名单(时间序列),你想看看谁的平均表现最好。为了评判他们,你使用了一张“计分卡”(适当评分规则),每当他们犯错时,就会给出一个惩罚数值。数值越低,表示球员越优秀。

这篇论文讨论的是当你拥有众多球员和众多比赛时,该如何阅读这张计分卡。作者发现,我们通常统计分数的方式有时会误导我们,让我们选错球员,尤其是在比赛进程较短或错误虽然罕见但影响巨大的情况下。

以下是使用简单类比进行的解析:

1. 问题所在:两种计数方法

当你拥有一支球员队伍时,你不能只看一场比赛。你必须结合他们的结果。论文指出,教练们通常有两种主要的统计方式:

  • 方法 A:“平均惩罚值”(均值缩放得分)。 你记录一名球员获得的每一个惩罚点数,将它们全部相加,然后除以比赛场数。这告诉了你错误的平均成本。
  • 方法 B:“胜负记录”(平均排名)。 你不看具体的分数。相反,你只是询问:“在多少场比赛中,球员 A 击败了球员 B?”你统计的是胜场。如果球员 A 赢得了更多的比赛,他就获得顶尖位置。

2. 陷阱:“巨大错误”造成的偏差

作者发现,对于某些类型的预测(例如预测稀有事件或高数值),“计分卡”是倾斜的

类比:
想象一场比赛,你通常只会犯一些小错误(比如绊到鞋带),但偶尔你会犯一个巨大的、灾难性的错误(比如掉下悬崖)。

  • “平均惩罚值”(方法 A) 看到了掉下悬崖的过程。它累加了所有的绊脚动作和那一次巨大的坠落,给出了一个很高的平均惩罚。它知道你是危险的。
  • “胜负记录”(方法 B) 是逐场观察比赛的。在 100 场比赛中的 99 场里,你只是绊了一下鞋带,这是一个微小的惩罚。而在剩下的 1 场中,你掉下了悬崖。
    • 如果你的对手是一个从不掉下悬崖、但绊脚次数稍多的对手,方法 B 可能会说:“嘿,你赢了 99 场!你是冠军!”
    • 方法 A 会说:“等等,那一次掉下悬崖让你损失了整个赛季。你的平均惩罚实际上更糟。”

论文认为,方法 B(平均排名) 是危险的,因为它忽略了错误的大小。它只关心谁在单个回合中赢得多。如果“掉下悬崖”(巨大的错误)是罕见的,方法 B 往往会漏掉它们,尤其是在你观察的比赛不够多(测试集较短)的情况下。

3. 解决方案:观看更多比赛

作者通过模拟实验,观察了当我们观看更多比赛时(增加测试集规模)会发生什么。

  • 短测试集(比赛较少): 方法 B 是不可靠的。它经常会选出一个靠着偶然避开了大错而显得“幸运”的玩家,即便该玩家的平均表现其实更差。
  • 长测试集(比赛较多): 随着你观看的比赛越来越多,“掉下悬崖”的情况最终会频繁出现,从而让方法 B 开始看到真相。此时,两种方法会趋于一致。

核心发现: 如果你只有较短的数据历史(短测试集),方法 A(平均惩罚值) 是唯一能始终如一地选出真正最佳模型的办法。方法 B 太容易被规避罕见巨大错误的“运气”所蒙蔽。

4. 现实世界测试:M5 竞赛

作者利用来自著名的“M5 预测竞赛”的真实数据对论文进行了测试,该竞赛涉及预测成千上万种产品的销量(其中一些是“间歇性”的,即销售非常罕见)。

他们对比了两个数学模型:

  1. 泊松模型 (Poisson Model): 一个较简单的模型。
  2. 负二项分布模型 (Negative Binomial Model): 一个以处理“需求激增”能力更强而闻名的复杂模型。

发生了什么?

  • 当在短数据上使用 方法 B(平均排名) 时,它经常会选择 泊松模型。它认为这个较简单的模型更好,因为它在单个回合中“赢”得更多。
  • 当使用 方法 A(平均惩罚值) 时,它始终能选出 负二项分布模型,正确识别出后者在处理那些巨大的需求激增方面表现更好。

作者得出结论,“平均惩罚值” 才是正确的。“胜负记录” 被骗了,因为它在测试集过短时,无法捕捉到那些由于模型缺陷导致的罕见且巨大的错误。

5. 衡量惩罚的方式是否重要?

论文还检查了改变衡量惩罚的“尺子”(缩放因子)是否会改变结果。

  • 好消息: “平均惩罚值”方法非常稳健。无论你用美元、百分比还是相对于基准线来衡量惩罚,它几乎总能选出相同的获胜者。
  • 坏消息: “胜负记录”方法非常脆弱。它会根据你衡量方式的不同以及你拥有的数据量多少而产生波动。

总结

如果你想挑选最好的预测模型:

  1. 不要只数胜场。(不要仅仅依赖平均排名)。
  2. 观察错误的平均成本。(使用平均缩放得分)。
  3. 对短数据保持警惕。 如果你的历史数据不够长,“胜负记录”法很可能会误导你,让你选出一个在纸面上看起来很好、但在罕见重大事件发生时会失败的模型。

这篇论文本质上是在说:“不要因为一个通过躲避一次巨大灾难而获得好运的玩家,就误以为他是最优秀的玩家。要看他的整体平均表现。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →