← 最新论文
📊 statistics

A note on the optimum allocation of resources to follow up unit nonrespondents in probability

本文提出了一种在概率调查中优化分配无应答随访资源的方法,旨在最小化估计量的均方误差,而非仅仅是最大化响应率,并通过使用来自澳大利亚一项农业调查的数据展示了其应用。

原作者: Su-Ming Tam, Anders Holmberg, Summer Wang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Su-Ming Tam, Anders Holmberg, Summer Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解关于整个城市人口之谜的侦探,但你只能采访一小群随机的人。这就是概率调查(probability surveys)的世界,是政府和研究人员用来了解从田间有多少只羊到人们对工作感受如何等各种信息的统计工具。但大问题在于?并不是每个人都会开门。有些人无视侦探,有些人挂断电话,还有些人干脆拒绝交谈。这被称为无应答(nonresponse)

长期以来,这些侦探的标准规则一直很简单:“敲每一扇没回应的门,直到有人开门为止。”其目标是获得尽可能高的应答率(response rate)——即说“是”的人所占的百分比。逻辑是:如果你接触的人越多,你对城市的画像就越清晰。然而,统计学家们已经意识到,高应答率并不总是意味着高质量的画像。你可能敲了一千扇门,最后却发现回答的人都来自同一个街区,从而让你对整个城市的看法产生偏差。真正的目标并不是获得更多的“是”的回答,而是在你拥有的预算内获得尽可能准确的答案。这篇论文提出了一个至决性的问题:如果你有有限的敲门预算,你应该如何分配资金,才能获得最好的结果,而不仅仅是获得最响亮的结果?


侦探的困境:为什么敲每一扇门可能是浪费时间

在官方统计领域(例如澳大利亚统计局收集的数据),存在着成本质量之间经典的拉锯战。调查统计学家有一笔用于“无应答随访”(NFU)的预算——即用于追逐那些第一次没有回应的人所花费的金钱和时间。传统的策略是利用这笔预算去跟进每一个无应答者,希望能把他们转化为应答者。当时的逻辑是:“应答者越多,数据越好。”

但本文作者 SM Tam、A Holmberg 和 S Wang 认为,这就像一名侦探为了能说自己“尝试过”,就不断地试图采访同一个不配合的证人,却忽略了其他能更快破案的线索。他们指出,应答率是衡量数据质量的一个糟糕指标。有时,提高应答率实际上会通过引入更多偏差来使数据变得更

与其追求高应答率,作者提出了一种新策略:最小化均方误差(Mean Squared Error, MSE)。简单来说,MSE 是衡量你的猜测与真实答案之间差距的一种度量。目标是这样分配你的随访资金,使你的最终估计值尽可能接近真相,而不仅仅是看起来声势浩大。

新策略:“响应同质性组”图谱

为了解决这个问题,作者建议了一种听起来有点像电子游戏攻略指南的方法。他们将无应答者分为称为响应同质性组(Response Homogeneity Groups, RHGs)的组别。可以将这些组视为每个人都有相似“交谈意愿”得分(即倾向得分/propensity score)的社区。

  • A 组: 如果你态度温和一点,非常容易回答的人(高倾向)。
  • B 组: 非常固执、无论你怎么做都不太可能回答的人(低倾向)。

论文认为你不应该对所有人一视同同。如果你预算有限,你不应该在尝试劝说超级固执的 B 组成员五次之后,仍然浪费精力在那里;相反,你应该把精力集中在那些只需多敲几次门就能带来新的、有用信息的组别上。

作者使用了一个称为**准随机化(quasi-randomisation)逆倾向加权(inverse propensity weighting)*的数学框架。想象你在给人群拍照。如果你只拍摄前排的人,你的照片就会产生偏差。但如果你准确知道后排有多少人以及他们走上前排的可能性有多大,你就可以通过数学手段“拉伸”照片,使其看起来像是你看到了所有人。本文建议利用这种数学方法来决定谁*值得进行额外的随访访问。

绵羊农场实验

为了测试他们的想法,作者使用来自澳大利亚 2018/19 年农村环境与农业商品调查(REACS) 的真实数据进行了模拟实验。他们试图估算农场上的绵羊数量。

实验设置如下:

  1. 数据: 他们查看了 4,696 个农场。其中 3,525 个是持续经营的农场(以前接受过调查),1,171 个是新农场。
  2. 预测: 他们使用了一种名为**随机森林(Random Forest)**的计算机算法(一种类似于决策树团队的机器学习类型)来预测每个农场回应的可能性。对于新农场,他们使用了“k-最近邻(k-Nearest Neighbors)”方法,通过寻找最相似的老农场来预测新农场的行为。
  3. 分组: 他们根据农场回应的可能性,将所有未回应的农场分成了 10 个组(RHG),范围从“极不可能”(0% 到 10% 的机会)到“极有可能”(90% 到 100% 的机会)。
  4. 预算: 他们设定了一个假设的随访预算为 30,000 美元

结果:聪明地花钱,而不是辛苦地花钱

作者使用了一个计算机求解器(类似于超级智能计算器)来计算每个组的最佳随访次数,以在不超出预算的情况下最小化绵羊数量的误差。

旧方法(常规做法):
如果你只是对每扇门敲同样次数,你可能会把太多时间花在超级固执的农场上(那里几乎得不到结果),而忽略了那些“可能”的农场。在他们的模拟中,这种“一刀切”的方法花费了 30,000 美元,并获得了 99% 的应答率。然而,他们对绵羊数量估计的误差仍然相对较高。

新方法(最优分配):
作者的方法提出了一个截然不同的计划:

  • 对于“极不可能”的组别: 对第一组敲 6 次,对第二组敲 5 次。这些组别的方差较大,意味着它们对整体估计的不确定性贡献最大。通过向这些组分配更多访问,该策略针对的是那些能最大限度降低误差的特定组别。
  • 对于“极有可能”的组别: 只敲 1 次。这些人本来就很可能回答,你不需要浪费钱敲 6 次。
  • 成本: 这个聪明的策略仅花费了 19,640 美元(大约是预算的三分之二)。
  • 结果: 即便如此,他们也将无应答方差(nonresponse variance)(由缺失人员导致的误差)从 577.7 亿单位降低到了 382.1 亿单位

巨大的惊喜:
“常规做法”获得了 99% 的应答率,而“最优策略”仅获得了 97% 的应答率

  • 常规做法: 99% 应答率,误差较高,成本 30,000 美元。
  • 最优策略: 97% 应答率,更低的误差,成本 19,640 美元。

实验表明,99% 的应答率是一个“虚假的胜利”。它看起来很漂亮,但成本更高,且给出的绵羊种群画像其实更不准确。最优分配方案不仅节省了资金,还提供了更好的答案,即便在“说‘是’的人”更少的情况下也是如此。具体而言,与标准的“敲每一扇门”方法相比,最优分配减少了约 3.9% 的无应答方差。(注:文中提到的 10.4% 的减少是指与“完全不做随访”相比的均方根误差的减少,而非与标准方法相比)。

这对未来意味着什么

作者得出结论:追求高应答率是一个陷阱。这就像试图通过仅仅数一下你喊了多少次“将军!”来赢得比赛,而不是真正检查是否握有获胜的手牌。

他们的研究结果表明,调查统计学家应该停止试图转化每一个无应答者。相反,他们应该利用数据来识别哪些群体需要一点额外的推动,而哪些群体已经做得很好。通过根据能最大限度降低**均方误差(MSE)**的地方来分配资源,机构可以以更少的资金获得更好的数据。

在特定的绵羊调查案例中,最优分配方案与“不做任何事”相比显著降低了误差,且与标准的“敲每一扇门”方法相比,虽然降幅较小但依然具有意义,同时还节省了数千美元。本文并不声称这对于所有问题都是灵丹妙药,但它提供了一种清晰且具有数学依据的方法,让调查随访变得更聪明,证明了有时,知道何时停止敲门与知道何时开始敲门同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →