Prior-Free Sample Size Design for Test-and-Roll Experiments
本文提出了一种无先验的最坏情况边际收益(WMB)规则,用于设计测试与滚动实验,该规则通过建立实用的“三分之一法则”基准,克服了标准极小化最大遗憾法的局限性,并指出对于高斯分布和伯努利分布的结果,最优样本量约为总体规模的三分之一。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一家拥有固定数量员工(假设为 N 人)的公司的经理。你有两款新的软件工具:工具 A 和 工具 B,你需要选出能让所有人更高效的那一款。目前你还不知道哪一款更好。
你有两种推进方案可供选择:
- “全面推广”方案:直接选一款工具,立即给所有人使用。(速度快,但如果选错了,风险很大)。
- “测试后推广”方案:首先,让一小部分员工(设人数为 m)参与小型实验。将其中一半人分配使用工具 A,另一半人分配使用工具 B。观察哪一款效果更好。然后,将胜出的工具推广给其余所有员工。
核心困境:实验中应该有多少人?
这是本文的核心问题。它本质上是探索(学习)与利用(运用已知)之间的经典拉锯战。
- 如果测试人数过少(m 很小):你可能运气好选对了工具,但也可能选错。一旦选错,你就必须将这款工具推广给公司其余所有人,导致生产力遭受巨大损失。
- 如果测试人数过多(m 很大):你几乎肯定能知道哪款工具更好。然而,在测试期间,实验中有一半的人被迫使用较差的工具。如果你测试了公司 90% 的员工,你只是为了求稳,就浪费了 45% 劳动力的生产力。
本文提出的问题是:测试多少人(m)才是完美的,从而使整个公司的总幸福度(福利)最大化?
旧方法:“胆小”的经理
作者首先考察了统计学家通常如何解决这个问题,即使用一种称为“绝对最小最大后悔值”(Absolute Minimax Regret)的方法。你可以将其想象为一位极度恐惧最坏情况的经理。
这位经理会想:“如果这两款工具几乎一模一样,但其中一款仅仅好那么一点点呢?如果我测试太多人,就是在浪费时间。但如果我测试太少,我可能会选错!”
由于这种方法过于聚焦于绝对最坏的情况(即工具几乎相同且犯错成本极高),它变得过度谨慎。它告诉经理:“别测试任何人!直接猜测并立即推广。”
本文认为这很荒谬。在现实世界中,我们知道需要一些数据才能做出明智的决策。“胆小”的方法导致的实验规模太小,毫无用处。
新方法:“边际”经理
作者提出了一条新规则,称为最坏情况边际收益(Worst-case Marginal Benefit, WMB) 规则。
这位经理不再问“整个项目可能发生的最坏情况是什么?”,而是问一个更简单、分步的问题:
“再增加一对人进入实验,值得吗?”
- 成本:增加两个人意味着在测试期间,有两个人必须使用潜在较差的工具。
- 收益:增加两个人能让我们获得稍多一点的信息,从而降低我们在将工具推广给公司其余人员时犯错的几率。
经理会持续向测试中添加人员,只要收益(避免未来推广犯错)大于成本(浪费当前测试对象的生产力)。一旦增加下一对人员的成本超过收益,他们就停止。
神奇数字:“三分之一法则”
在进行了大量数学推导(文中通过复杂公式和高斯近似进行了详细阐述)之后,作者得出了一个令人惊讶的简单答案。
无论数据是“是/否”类型(如抛硬币)还是“数值”类型(如考试成绩),最优策略几乎总是:
测试你总人数的 1/3,将剩余 2/3 进行推广。
- 如果你有 300 人:测试 100 人,推广给 200 人。
- 如果你有 3,000 人:测试 1,000 人,推广给 2,000 人。
为什么这很重要?
- 无需猜测:你不需要事先猜测工具的好坏(无需“先验”)。你只需要知道总人数是多少。
- 稳健性强:即使你不知道问题的确切细节,只要不处于奇怪、极端的边缘情况(例如一款永远无效的工具),该方法依然有效。
- 平衡尺度:它既阻止了“胆小”的经理测试过少,也阻止了“强迫症”式的经理测试过多。
总结
本文指出,当你拥有一个固定的人群群体,并需要在两个选项之间做出选择时,平衡“学习”与“行动”的最佳方式是:将群体的三分之一用于实验,将另外三分之二用于最终决策。这一规则简单明了,不需要复杂的猜测,并能保护群体免受无效努力和错误决策的双重伤害。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。