← 最新论文
📈 economics

Prior-Free Sample Size Design for Test-and-Roll Experiments

本文提出了一种无先验的最坏情况边际收益(WMB)规则,用于设计测试与滚动实验,该规则通过建立实用的“三分之一法则”基准,克服了标准极小化最大遗憾法的局限性,并指出对于高斯分布和伯努利分布的结果,最优样本量约为总体规模的三分之一。

原作者: Kentaro Kawato, Shosei Sakaguchi

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Kentaro Kawato, Shosei Sakaguchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家拥有固定数量员工(假设为 N 人)的公司的经理。你有两款新的软件工具:工具 A工具 B,你需要选出能让所有人更高效的那一款。目前你还不知道哪一款更好。

你有两种推进方案可供选择:

  1. “全面推广”方案:直接选一款工具,立即给所有人使用。(速度快,但如果选错了,风险很大)。
  2. “测试后推广”方案:首先,让一小部分员工(设人数为 m)参与小型实验。将其中一半人分配使用工具 A,另一半人分配使用工具 B。观察哪一款效果更好。然后,将胜出的工具推广给其余所有员工。

核心困境:实验中应该有多少人?

这是本文的核心问题。它本质上是探索(学习)与利用(运用已知)之间的经典拉锯战。

  • 如果测试人数过少(m 很小):你可能运气好选对了工具,但也可能选错。一旦选错,你就必须将这款工具推广给公司其余所有人,导致生产力遭受巨大损失。
  • 如果测试人数过多(m 很大):你几乎肯定能知道哪款工具更好。然而,在测试期间,实验中有一半的人被迫使用较差的工具。如果你测试了公司 90% 的员工,你只是为了求稳,就浪费了 45% 劳动力的生产力。

本文提出的问题是:测试多少人(m)才是完美的,从而使整个公司的总幸福度(福利)最大化?

旧方法:“胆小”的经理

作者首先考察了统计学家通常如何解决这个问题,即使用一种称为“绝对最小最大后悔值”(Absolute Minimax Regret)的方法。你可以将其想象为一位极度恐惧最坏情况的经理。

这位经理会想:“如果这两款工具几乎一模一样,但其中一款仅仅好那么一点点呢?如果我测试太多人,就是在浪费时间。但如果我测试太少,我可能会选错!”

由于这种方法过于聚焦于绝对最坏的情况(即工具几乎相同且犯错成本极高),它变得过度谨慎。它告诉经理:“别测试任何人!直接猜测并立即推广。”

本文认为这很荒谬。在现实世界中,我们知道需要一些数据才能做出明智的决策。“胆小”的方法导致的实验规模太小,毫无用处。

新方法:“边际”经理

作者提出了一条新规则,称为最坏情况边际收益(Worst-case Marginal Benefit, WMB) 规则。

这位经理不再问“整个项目可能发生的最坏情况是什么?”,而是问一个更简单、分步的问题:
“再增加一对人进入实验,值得吗?”

  • 成本:增加两个人意味着在测试期间,有两个人必须使用潜在较差的工具。
  • 收益:增加两个人能让我们获得稍多一点的信息,从而降低我们在将工具推广给公司其余人员时犯错的几率。

经理会持续向测试中添加人员,只要收益(避免未来推广犯错)大于成本(浪费当前测试对象的生产力)。一旦增加下一对人员的成本超过收益,他们就停止。

神奇数字:“三分之一法则”

在进行了大量数学推导(文中通过复杂公式和高斯近似进行了详细阐述)之后,作者得出了一个令人惊讶的简单答案。

无论数据是“是/否”类型(如抛硬币)还是“数值”类型(如考试成绩),最优策略几乎总是:

测试你总人数的 1/3,将剩余 2/3 进行推广。

  • 如果你有 300 人:测试 100 人,推广给 200 人。
  • 如果你有 3,000 人:测试 1,000 人,推广给 2,000 人。

为什么这很重要?

  1. 无需猜测:你不需要事先猜测工具的好坏(无需“先验”)。你只需要知道总人数是多少。
  2. 稳健性强:即使你不知道问题的确切细节,只要不处于奇怪、极端的边缘情况(例如一款永远无效的工具),该方法依然有效。
  3. 平衡尺度:它既阻止了“胆小”的经理测试过少,也阻止了“强迫症”式的经理测试过多。

总结

本文指出,当你拥有一个固定的人群群体,并需要在两个选项之间做出选择时,平衡“学习”与“行动”的最佳方式是:将群体的三分之一用于实验,将另外三分之二用于最终决策。这一规则简单明了,不需要复杂的猜测,并能保护群体免受无效努力和错误决策的双重伤害。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →