← 最新论文
📊 statistics

Why Empirical p-Values Are Not Uniform: Reference Samples, Dependence, and PIT Backtesting

本文表明,源于有限参考样本的实证 p 值因诱导依赖性和方差失真而偏离预期的均匀分布,因此需要修订回测校准方法,以考虑潜在的两阶段抽样结构,而非将其视为独立的均匀随机抽取。

原作者: Jakub Lis

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakub Lis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心思想:“完美地图”与“粗略草图”

想象一下,你试图判断一个新来的人与你已知的一组人相比有多“普通”。

在统计学的完美世界(理论)中,你拥有“上帝视角”。你清楚世界上所有人的分布情况,拥有一张精确完美的地图。如果你拿一个新来的人问:“有多少百分比的人比你矮?”答案就是一个概率积分变换(PIT)。如果你的模型是正确的,这些答案应该是 0 到 1 之间完全随机的数字,就像从帽子里随机抽出一个数字一样。

问题所在: 在现实世界(实践)中,我们没有那张完美地图。我们只有一个参考样本——即我们迄今为止测量过的一小群人。要回答“有多少百分比的人比你矮?”这个问题,我们必须基于这一小群人进行猜测。我们利用这些有限的数据,绘制出一张分布的“粗略草图”。

论文的发现: 作者 Jakub Lis 指出了一个隐藏的陷阱。当我们使用这张“粗略草图”(经验估计值)代替“完美地图”时,我们得到的数字不再表现得像随机数字。它们会发生扭曲。如果我们把它们当作完美的随机数字来处理,我们的统计检验就会给出错误的结论。


三种场景:我们如何绘制草图

该论文考察了人们试图绘制这张“粗略草图”以检验模型的三种不同方式。每种方法都以不同的方式破坏了规则。

1. “单一固定组”方法(Common-Sample)

类比: 想象你是一位老师,正在给 100 名学生打分。为了判断一名学生是否“普通”,你会将他们与一个单一的、固定的班级进行比较,这个班级由你在年初测量的 50 名学生组成。你使用这同一组 50 名学生来给所有 100 名新学生打分。

出了什么问题:
因为你用同一组50 名学生来评估所有人,所以这特定 50 人中的任何错误或怪异之处都会被复制到所有 100 个新分数上。

  • 如果这 50 人碰巧异常高,你的“平均”线就会对所有人都向上偏移。
  • 论文表明,这里的数学不再看起来像“单样本检验”(将一组数据与完美规则进行核对),而开始看起来像**“双样本检验”**(将两个混乱的组相互比较)。
  • 结果: 如果你使用假设数字相互独立的常规检验,你会得到误报。你可能会认为你的模型出了问题,而实际上它很好,反之亦然。

2. “每人一组新样本”方法(Independent Reference)

类比: 现在,想象对于 100 名学生中的每一位,你都拉出一个全新的、不同的50 人小组来与他们进行比较。

哪里做对了:
这是唯一行之有效的方法。因为参考组中的“噪声”或错误对每个学生来说都是不同的,它们会相互抵消。

  • 这一组可能太高,下一组可能太矮。当你把它们全部平均后,误差就消失了。
  • 结果: 数字的表现几乎完全符合预期。常规检验在这里有效,因为这些“粗略草图”平均起来看起来就像“完美地图”。

3. “滑动窗口”方法(Rolling Window)

类比: 这就像一扇滑动门。你将一名学生与刚刚走过这扇门的 50 人进行比较。然后,这名学生走过门,成为下一个人所在群体的一部分。

出了什么问题:
这产生了一种连锁反应。

  • 学生 A 帮助定义了学生 B 的群体。
  • 学生 B(受 A 影响)帮助定义了学生 C 的群体。
  • 数字不再相互独立;它们变得“粘滞”或自相关
  • 结果: 论文发现,这种方法抑制了数据中自然的“波动”或方差。数字看起来过于稳定、过于完美。如果你对此运行常规检验,可能会因为数据看起来具有欺骗性的平滑而错过真正的问题。

核心结论

论文认为,我们一直将这些“粗略草图”(经验 p 值)当作“完美地图”来对待。

  • 错误: 我们假设,既然理论说数字应该是均匀(随机)的,那么我们从实际数据中计算出的数字也是均匀的。
  • 现实: 使用有限样本估计地图这一行为,改变了数字的性质。
    • 如果你使用一个固定组,你实际上是在进行两组比较,而不是一组检查。
    • 如果你使用滑动窗口,你的数字就像链条一样相互连接,打破了独立性的规则。

结论:
为了解决这个问题,我们不能仅仅使用那些假设数据独立且完美均匀的常规“拟合优度”检验(如柯尔莫哥洛夫 - 斯米尔诺夫检验)。我们需要新的、修订后的方法,以考虑到我们是用有限的砖块来构建地图这一事实。如果我们不对此进行调整,我们的回测(检查风险模型是否有效)可能会产生误导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →