← 最新论文
📊 statistics

An Old Look at Empirical Bayes

本文批评现代经验贝叶斯方法混淆了层级并歪曲了不确定性,认为随着全层级建模成本的降低,计算资源应转而用于真正符合层级结构的贝叶斯方法。

原作者: Nicholas G. Polson, Vadim O. Sokolov, Daniel Zantedeschi

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas G. Polson, Vadim O. Sokolov, Daniel Zantedeschi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《重新审视经验贝叶斯》的解读。

大局观:来自过去的警示

想象一位名叫丹尼斯·林德利(Dennis Lindley)的著名统计学家曾开过一个玩笑:“只有一件事比死板的规则遵循者(频率学派)更糟糕,那就是试图根据当前正在玩的游戏来制定自己规则的规则遵循者(经验贝叶斯学派)。”

这篇由波森(Polson)、索科洛夫(Sokolov)和赞特德斯奇(Zantedeschi)撰写的论文,重新审视了这个玩笑。他们关注的是戴维·布莱(David Blei)在 2026 年提出的一种“经验贝叶斯”的新高科技版本。虽然布莱的新方法极其强大,并利用了现代计算机(如神经网络)等花哨的工具,但作者们认为,布莱仍在犯同样的老错误。

这个错误就是:重复使用同一组数据。

核心问题:“双重利用”

要理解这篇论文,让我们使用一个侦探与嫌疑人的类比。

  1. 理想侦探(完全分层贝叶斯):

    • 侦探首先拥有一套关于罪犯行为模式的通用理论(“先验”)。
    • 他们查看犯罪现场的具体证据(“数据”)。
    • 他们将理论与证据结合,以推断出真凶。
    • 结果: 得出一个公平、合乎逻辑的结论,同时尊重理论的不确定性。
  2. “经验”侦探(旧方法 & 布莱的新方法):

    • 侦探首先查看犯罪现场。
    • 他们根据所见,发明一套关于罪犯行为模式的新理论。
    • 然后,他们再次查看犯罪现场,利用同一份证据,结合他们刚刚发明的理论来破案。
    • 结果: 他们进行了“双重利用”。他们利用数据构建了规则,然后又利用数据应用这些规则。这使他们过于自信。他们认为自己比实际情况更了解答案,从而导致“覆盖率不足”(他们的置信区间过窄,导致他们比预期更频繁地错过真相)。

戴维·布莱在做什么?

戴维·布莱是一位现代统计学家,他提出了三种新的、花哨的方法来进行这种“经验贝叶斯”侦探工作:

  1. 对称性: 利用数据中的模式(如壁纸的重复图案)来猜测规则。
  2. 模拟: 当数学公式难以直接写出时,利用计算机模拟来猜测规则。
  3. 校准: 利用过去的实验来猜测新研究中的“偏差”。

作者们承认布莱的工具令人印象深刻。它们速度快,能处理复杂问题。然而,作者们认为,布莱只是给“双重利用”问题换了个名字。他不再只是猜测一个简单的数字(如平均值),而是利用数据猜测一个复杂的形状或分布,然后再次利用该数据进行预测。

三大主要批评

1. 名称游戏(“贝叶斯经验贝叶斯”)

布莱称他的方法为“贝叶斯经验贝叶斯”。作者们认为这具有误导性。

  • 真正的贝叶斯: 你写下一个支配你规则的“超级规则”(超先验),并让数学来处理不确定性。
  • 布莱的方法: 他利用数据找到最佳规则,然后将该规则视为既定事实。
  • 类比: 这就像一位老师批改试卷,然后根据全班平均分决定什么是“及格线”,最后再用这个新的及格线重新批改试卷。及格线不是在考试前决定的,而是由考试决定的。

2. “总体后验”与真实情况

布莱引入了一个名为“总体后验”(Population Posterior)的概念。

  • 作者的观点: 这实际上并不是一个“后验”(基于特定证据对特定事件的信念)。它是如果你运行一百万次实验会发生的平均结果。
  • 类比: 假设你想知道一枚特定的硬币是否公平。
    • 真实后验: “基于我翻转这枚特定硬币的 10 次结果,我认为它有 60% 的可能性是公平的。”
    • 总体后验: “如果我有像这样的一百万枚硬币,并且我把它们都翻转了,这是平均结果。”
    • 作者们认为,布莱将“一百万枚硬币的平均值”包装成好像是“这枚特定硬币”的答案。这对某些事情很有用,但它不是同一回事,将其称为“后验”会混淆人们对不确定性可信度的判断。

3. 蒂威公式(收缩机器)

现代统计学的很大一部分涉及“收缩”估计值(将极端数值拉向平均值以避免噪声)。

  • 问题: 一种流行的方法(f-建模)平滑数据以创建收缩规则。但有时,这种平滑后的规则并非源自任何逻辑上的“先验”或理论。它仅仅是一条数学曲线。
  • 解决方案: 作者们建议使用马蹄先验(Horseshoe Prior)
  • 类比: 想象一张渔网。
    • 坏网(f-建模): 你根据今天抓到的鱼来拉伸渔网。如果你抓到了一条小鱼,你就把网眼变小;如果你抓到了一条大鱼,你就把网眼变大。渔网的形状根据捕获物而改变。
    • 好网(马蹄先验): 你拥有一张具有特定设计的网(具有重尾以放过大鱼,具有紧密的网眼以捕捉小鱼)。你并不根据鱼来改变网的设计,你只是用这张网去捕鱼。“马蹄”是一种特定的、经数学证明的网的设计,它能在不破坏概率规则的情况下,完美地用于在噪声数据中寻找罕见的大信号。

作者们的解决方案:“直接写下规则”

这篇论文认为,在 2026 年,计算机速度如此之快,我们不再需要走捷径。

  • 旧借口: “我们无法计算完整的贝叶斯答案,因为它太难了,所以我们将使用经验捷径。”
  • 新现实: “我们现在可以计算完整的答案。成本微不足道。”

作者们建议,与其使用“双重利用”的捷径,研究人员应该:

  1. 为问题写下一个恰当的“超级规则”(超先验)。
  2. 利用现代计算机工具(如马蹄先验)来计算完整、诚实的答案。
  3. 这确保了不确定性被正确计算,并且结果是“连贯的”(它们相互一致)。

总结

这篇论文是对统计学中知识诚实的呼吁。

  • 布莱的计划: “看看这种利用数据猜测规则,然后再利用数据解决问题的惊人新方法!”
  • 作者们的回应: “这很巧妙,但它仍然是在重复使用数据。这就像一位侦探根据罪行制定法律,然后根据该法律逮捕嫌疑人。”
  • 建议: 停止试图用捷径耍小聪明。利用我们今天拥有的强大计算机,去做那件“枯燥”但正确的事情:写下完整的规则集(分层结构),并让计算机正确地解决它。这将为你提供你真正可以信赖的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →