← 最新论文
📊 statistics

The Likelihood Ratio Wall: Structural Limits on Accurate Risk Assessment for Rare Violence

本文认为,审前风险评估工具面临一个根本性的“似然比墙”,即暴力再犯的低发生率以及过度执法等结构性偏见在数学上阻碍了高置信度的个体化预测,致使现有工具倾向于产生高误报率,且无法通过重新校准加以修正。

原作者: Marco Pollanen

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Marco Pollanen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名法官,正试图决定是否在审判前将被告继续关押在监狱中。你拥有一项新的“风险工具”,它可以扫描被告的历史记录,并给他们贴上标签:“暴力高风险”。

该工具本应告诉你:“如果我们释放这个人,他们很有可能实施暴力犯罪。”

本文认为,从数学角度来看,当该工具声称某人对于罕见的暴力犯罪属于“高风险”时,它几乎总是在对你撒谎。即使该工具在纸面上看起来令人印象深刻,现实情况是,大多数被标记为“危险”的人,如果获释,实际上本会保持和平。

以下是使用简单类比对此现象的解析。

1. “大海捞针”问题(基础比率)

暴力再逮捕非常罕见。在大多数地方,每 100 名获释被告中,只有约 2 到 5 人会犯下新的暴力犯罪。

想象你是一名拥有 10,000 名观众的巨大体育场的保安。你正在寻找一个秘密携带武器的人(即“暴力罪犯”)。

  • 该“风险工具”就像一台金属探测器。
  • 问题在于,金属探测器并不完美。它有时会因皮带扣或钥匙等无害物品而发出警报(误报)。

由于“坏人”如此罕见(万分之一),即使是非常好的金属探测器,为无辜者响起的次数也远多于为实际威胁响起的次数。本文将此称为似然比墙

2. 你无法翻越的墙

作者证明了一条数学规则:若要50% 的时间是正确的(即,如果工具说“高风险”,那么此人确实具有危险性的概率只有五五开),该工具必须在识别“针”方面极其出色。

  • 现实情况:目前的工具就像一台金属探测器,每发现一把真正的枪,就会因皮带扣发出 10 次警报。
  • 要求:若要有一半的时间是正确的,该工具在识别枪支方面必须比识别皮带扣好 30 到 50 倍

类比:想象试图在沙滩上找到一粒特定的沙子。如果你的“找沙器”每找到 1 粒金砂就会捡起 100 粒沙子,而金砂极其罕见,你最终会捧着一桶沙子,以为找到了金子。工具并没有“坏掉”;只是金子太稀少了,导致工具无法有效工作。

本文表明,目前的工具远不足以跨越这道墙。当它们将某人标记为“高风险”时,通常是错误的。

3. 为什么“微调”工具无济于事(重新校准)

你可能会想:“难道我们不能只是调整工具的设置以提高其准确性吗?”

作者回答不行。他们证明,改变数值(重新校准)就像重新粉刷金属探测器。你可以让它看起来更花哨,或者改变警报的音量,但你无法改变它仍会因皮带扣而响的事实。

如果底层数据(逮捕历史、前科指控等)不包含足够强的信号来区分暴力与非暴力,那么无论多少数学技巧都无法凭空创造出这种信号。“墙”是一个结构性限制,而不是软件漏洞。

4. “监控天花板”(为什么某些群体更频繁地被标记)

本文还指出了一个残酷的讽刺:过度执法会使某些群体的工具表现更差。

想象两个社区,A 社区和 B 社区。

  • A 社区按正常频率接受警务巡逻。
  • B 社区受到过度执法。警察无处不在,频繁检查每个人的口袋和记录。

即使 B 社区的人并不比 A 社区的人更具暴力性,他们也会仅仅因为受到更严密的监视而积累更多的“风险标记”(如之前的逮捕或未能出庭)。

类比

  • 在 A 社区,一个人只有在真正做错事时才会获得“风险标记”。
  • 在 B 社区,一个人仅仅因为出现在错误的时间、错误的地点,或者因为 A 社区的警察会忽略的轻微违规行为,就会获得“风险标记”。

本文证明,由于 B 社区有更多的“虚假标记”(被系统标记的无辜者),该工具对他们的准确性更低。该工具达到了“监控天花板”,无论算法多么智能,它都无法做到精确。最终,它标记 B 社区无辜者的比率要高得多,使得“高风险”标签对他们的可信度更低。

5. “需拘留人数”(人力成本)

作者将这些数学问题转化为现实世界的成本:我们需要拘留多少人才能阻止一起暴力犯罪?

  • 如果工具的正确率仅为 11%(根据当前性能水平的数学计算结果),这意味着你必须拘留9 人才能预防1 起暴力犯罪
  • 这意味着这 9 人中的8 人并未犯下未来的暴力罪行,却不必要地被剥夺了自由。

结论

本文得出结论,对于罕见的暴力犯罪,我们目前拥有的数据(犯罪记录、逮捕历史)不足以支持关于关押人员的高置信度决策。

当法官看到“暴力高风险”标签时,他们被告知此人很可能具有危险性。但数学表明,该标签实际上在 10 次中有 8 到 9 次是错误的

建议
作者建议,如果我们继续使用这些工具,必须诚实地面对不确定性。报告不应仅仅说“高风险”,而应改为:

“此人被标记为高风险,但根据当前数据,该标记正确的概率仅为 11%。为了预防一起暴力犯罪,我们可能会拘留 9 名本不会犯罪的人。”

本文认为,在我们拥有比现在好 30 到 50 倍的数据之前,我们不应将这些“高风险”标签视为某人具有危险性的证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →