← 最新论文
🤖 AI

Compliant But Unsatisfactory: The Gap Between Auditing Standards and Practices for Probabilistic Genotyping Software

本文通过案例研究指出,ASB 018 审计标准因措辞模糊和术语未定义等设计缺陷,导致其在评估用于刑事司法系统的概率基因分型软件时,虽能实现形式合规却无法有效揭示系统缺陷或确立使用限制,从而在标准与实践之间造成了显著差距。

原作者: Angela Jin, Alexander Asemota, Dan E. Krane, Nathaniel D. Adams, Rediet Abebe

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Angela Jin, Alexander Asemota, Dan E. Krane, Nathaniel D. Adams, Rediet Abebe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于**“合规但令人失望”的研究报告。简单来说,它揭露了一个尴尬的现实:在美国的刑事司法系统中,用来分析 DNA 证据的 AI 软件(概率基因型生成软件,简称 PGS),虽然通过了官方规定的“体检”(审计),但这些体检报告往往“只走形式,没查出真毛病”**。

为了让你更容易理解,我们可以把这篇论文的内容想象成**“给一辆自动驾驶汽车做安全年检”**的故事。

1. 背景:谁在开车?谁在修车?

  • 场景:在法庭上,检察官经常拿出一种叫“概率基因型生成软件”(PGS)的 AI 工具,说:“看,这个 AI 算出来,被告人的 DNA 出现在犯罪现场的可能性是 99%!”
  • 问题:这个 AI 有时候会算错。为了让人放心,法律规定实验室在用它之前,必须自己先做“内部验证”(也就是审计),证明它很靠谱。
  • 规则:有一个叫 ASB 018 的“官方体检标准”,规定了实验室该怎么给这个 AI 做体检。

2. 核心发现:体检报告“合格”,但车其实“漏油”

研究人员找了 5 份真实的实验室体检报告,发现它们都符合ASB 018 的标准(也就是“合规”),但实际上完全没达到制定标准的人原本想要的效果(也就是“令人失望”)。

这就好比:

你给一辆车做年检,规定要求“检查刹车系统”。

  • 理想情况:你踩刹车,看车能不能停住,如果停不住就修好,并规定“车速超过 60 码时不能开”。
  • 实际情况(这篇论文发现的):实验室只是把刹车片拆下来看了看,说“刹车片还在,没碎”,然后就在报告上写“刹车系统检查通过”。他们没踩刹车测试,也没规定车速限制。
  • 结果:报告盖章说“合格”,但这辆车实际上在高速上根本刹不住。

3. 具体有哪些“猫腻”?(五大差距)

研究人员把审计过程分成了五个阶段,发现了以下“形似神不似”的问题:

A. 检查范围太窄(只查零件,不查司机)

  • 标准想看的:不仅要看 AI 软件本身,还要看使用软件的人(法医分析师)。因为人可能会输错参数,导致 AI 算错。
  • 实际做的:实验室只测试软件在“完美输入”下的表现。
  • 比喻:就像考驾照,只让车在自动驾驶模式下跑了一圈,完全没测试人类司机在紧张时会不会把油门当刹车踩。

B. 测试样本太“挑”(只走平坦路,不走过泥坑)

  • 标准想看的:用各种复杂的、真实的犯罪现场样本(比如 DNA 很少、混合了多人、样本降解了)来测试。
  • 实际做的:只挑简单的、干净的样本测试。
  • 比喻:驾校考试只让学员在空旷的停车场练车,完全没让学员在暴雨、堵车、路面结冰的复杂路况下开过。一旦上了真路(法庭),车就失控了。

C. 没有明确的“及格线”(模糊的“感觉不错”)

  • 标准想看的:必须提前定好标准,比如“错误率不能超过 1%"。如果超过,就是不合格。
  • 实际做的:报告里经常写“结果符合预期”、“数据看起来很直观”。
  • 比喻:老师批改试卷,没有写“满分 100 分,60 分及格”,而是写“这篇作文感觉写得挺不错"。到底多不错?不知道。只要老师觉得不错,就算过。

D. 把“故障”说成“正常”(掩耳盗铃)

  • 标准想看的:如果发现 AI 算错了(比如把好人说成坏人),必须明确指出这是失败,并划定“这种情况下不能用 AI"的界限。
  • 实际做的:实验室把明显的错误称为“非直观的结果”或者“意料之外的情况”,甚至说“只要分析师小心点就能避开”。
  • 比喻:刹车失灵了,修车师傅不说“刹车坏了”,而说“这车刹车有点太灵敏,以后开车小心点就行”。

E. 报告太简略(无法复现)

  • 标准想看的:报告要写得清清楚楚,让第三方(比如辩护律师)能看懂并重新算一遍。
  • 实际做的:关键数据(比如用了多少样本、具体数值)都藏着掖着,只给个大概。
  • 比喻:菜谱上只写“加少许盐”,却不写“少许”是多少克,也不写用了什么牌子的盐。别人想照着做,根本做不出来。

4. 为什么会这样?(标准的设计缺陷)

这篇论文指出,问题不在于实验室太坏,而在于ASB 018 这个“体检标准”本身设计得太烂

  1. 语言太模糊:标准里充满了“考虑一下”、“处理一下”、“评估一下”这种词。
    • 比喻:标准说“你要考虑一下刹车安全”。你“考虑”了(脑子里想了一下),就算完成了任务,根本不需要真的去踩刹车。
  2. 把整体拆散了:标准要求分别检查“软件性能”和“人的操作”,却没要求把它们结合起来看。
    • 比喻:要求分别检查“轮胎”和“司机”,却没人规定“轮胎 + 司机”组合在一起能不能跑。
  3. 太迁就现状:标准制定时,为了让大家都能通过,特意写得模棱两可,让实验室不用改变现有的习惯就能“合规”。
    • 比喻:为了不让驾校改革,体检标准直接照搬了“只要车没散架就算合格”,完全不管能不能上路。

5. 结论与建议:如何修好这个“体检系统”?

作者最后提出,要解决这个问题,不能只靠实验室自觉,必须重写规则

  • 说人话,定死规矩:别用“考虑”、“评估”这种词。要规定“必须测试 100 个样本”、“错误率必须低于 1%"。
  • 明确谁负责:规定清楚是软件公司负责,还是实验室负责,不能互相踢皮球。
  • 请“挑刺”的人参与:制定标准时,不能只让实验室和软件公司参加,必须把辩护律师独立专家叫进来。
    • 比喻:制定交通规则时,不能只让司机交警商量,还得让行人受害者也来提意见,否则规则永远偏向司机,行人永远不安全。

总结

这篇论文告诉我们:“符合标准”不等于“安全有效”。如果制定规则的人(标准制定者)不够严谨,规则就会变成一种**“洗白工具”**(Audit Washing),让有缺陷的 AI 系统披上合法的外衣,在法庭上误导法官和陪审团,最终可能让无辜的人背黑锅。

我们需要更透明、更具体、更“较真”的审计标准,才能真正保护正义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →