Bayesian Inference for Multi-Source Binary Data with Selection and Measurement Error
本文引入了一个贝叶斯建模框架,该框架共同处理多源二元数据中的误分类误差和选择误差,并通过模拟和实证分析表明,虽然复合误差可以被稳健地识别,但将其准确分解为特定成分则需要有效的指标、辅助变量和信息先验。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚一座大城市里有多少人热爱辣味披萨。你有两种询问方式。第一种是科学调查,即随机敲门,这就像是“概率抽样”,每个人都有公平的机会被询问。第二种是查看一个加入辣味披萨俱乐部的名单,这就像是“行政数据”或“非概率抽样”。这个俱乐部名单可能拥有数百万个名字,但它是有偏差的,因为只有披萨爱好者才会加入,而且也许俱乐部的报名表上还存在拼写错误。
在统计学领域,研究人员经常尝试将这两类名单结合起来,以获得更好的答案。但这里有一个难点:俱乐部名单可能会遗漏那些热爱辣味披萨但讨厌报名的人(这就是选择误差),而且报名表可能会误将某个真正热爱的人记录为“不辣”(这就是测量误差)。通常情况下,统计学家会尝试一次只解决一种错误,就像试图通过只拉住绳子的一端来解开一个结。但如果这个结太紧了呢?如果需要同时拉动两端才能看到全貌呢?这正是荷兰和美国的一个研究团队决定解决的谜题。他们构建了一个新的数学工具来同时解开这些交织在一起的错误,从而帮助我们理解我们的数据在多大程度上在“撒谎”,以及原因何在。
由桑地亚哥·戈麦斯-埃切韦里(Santiago Gómez-Echeverry)及其同事领导的研究人员创建了一个聪明的“侦探工具包”,称为贝叶斯建模框架。把他们的这种方法想象成一位超级聪明的侦探,他不仅观察线索(数据),还会带来一队专家(称为“先验知识”)来帮助推测真相可能是什么。在他们的案例中,这位侦探使用了一种特殊的“二元潜在类别混合模型”。想象一个神奇的盒子,它接收来自我们披萨名单的混乱、不完美的答案,并试图猜测隐藏在其中的真实披萨爱好者数量。
这里的魔术在于:该模型观察“真实”总体与“观测”样本之间的差异。它意识到总误差(复合误差)是由两部分组成的:测量误差(报名表上的拼写错误)和选择误差(只有披萨爱好者才报名)。作者使用计算机模拟测试了他们的侦探工具包,创造了具有不同水平的拼写错误和不同水平偏差的虚拟世界。他们发现,无论数据多么混乱,他们的模型都能极其出色地识别出总误差量。这就像侦探总能告诉你:“嘿,这份名单偏差了整整15%,”并且非常有信心。
然而,当侦探试图将这15%的误差拆分为“多少是由拼写错误引起的”以及“多少是由偏差引起的”时,故事变得复杂了。模拟显示,虽然总误差很容易找到,但要区分这两个原因却很困难。这就像是在试图弄清楚一个蛋糕的甜味中有多少来自于糖,又有多少来自于蜂蜜,而它们已经完美地混合在一起了。只有当侦探拥有非常好的线索时(可靠的指标:一份干净的报名表;有用的额外信息:比如知道签名者的年龄;以及强有力的专家猜测:信息丰富的先验知识),模型才能成功完成这种拆分。如果没有这些,模型可以告诉你总误差很大,但它并不总能准确说明误差的具体来源。
为了证明这在现实世界中行之有效,该团队将他们的模型应用于来自美国政府的实际数据,将**当前人口调查(CPS)与美国时间利用调查(ATUS)**联系起来。他们试图弄清楚有多少人拥有“高收入”(定义为超过4万美元)。他们将 CPS 视为他们可靠的随机调查,而将 ATUS 视为那个有偏差的“俱乐部名单”。正如他们在模拟中所做的那样,模型成功识别了收入估算中的总误差。但同样地,一旦要精确界定这种误差中有多少来自于 ATUS 的偏差,有多少来自于数据的错误记录,就需要精心的设置和专家的知识。
作者得出结论,他们的工具是处理多源数据的一种稳健方法,但它并不是一个能自动解决一切问题的魔杖。这表明,为了获得关于我们的数据为什么出错的最细致、最深入的理解,我们需要非常谨慎地准备数据,并引入领域专家来引导模型。如果我们只是把数据扔进盒子里而没有好的线索,我们可能知道整体有多乱,但我们不会知道具体该如何清理它。他们的工作并不声称已经永远解决了坏数据的问题,而是为在现代统计学这一混乱、混合的世界中航行提供了一张更清晰的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。