The Checking Problem: What must be true before AI ships in a regulated firm
本文表明,企业级人工智能在受监管金融服务领域的可行性,与其说取决于原始准确度,不如说取决于可验证的归因和置信度信号等可衡量属性,这些属性可以显著降低生产部署所需的环节中人工审查的负担。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名飞船舰长,刚刚雇佣了一名全新的、超级聪明的机器人副驾驶来协助你导航。你进行了一次快速测试:你让机器人指向地图上的某颗恒星,它完美地做到了。你击了个掌,船员们欢呼雀跃,你们准备好启航了。但问题在于:在现实世界的太空旅行(或高风险的银行金融领域)中,仅仅一次完美的测试是不够的。你需要知道机器人是否每次被要求时都能指向同一颗恒星,它是否能展示出它在地图上看到那颗恒星的具体位置,以及它能否诚实地告诉你:“这个我不确定。”
这正是研究员普里特·阿胡贾(Pret Ahuja)的一项新研究的核心,该研究深入探讨了“企业级 AI”中混乱的现实。把这想象成在研究为什么这么多公司试图使用 AI 来处理文书工作,却最终碰壁。这篇论文聚焦于几个关键概念:准确性(得到正确答案)、可复现性(两次得到相同的答案)、可靠性/溯源性(能够展示其推导过程)以及可检测性(知道自己错了)。核心问题不仅仅是“AI 是否聪明?”,而是“这个 AI 是否足够安全,可以让我们在没有人类时刻盯着的情况下让它工作?”
“演示陷阱” vs. “实战真章”
论文首先指出了一个被称为“演示陷阱”(Demonstration Trap)的隐蔽问题。想象你向一群投资者展示一个魔术表演。你从帽子里变出了一只兔子,表现得完美无缺。他们印象深刻。但如果你尝试连续做 100 次同样的魔术,也许兔子累了,或者帽子卡住了,或者你意外地变出了一只鞋子。
在受监管的金融领域(规则严格且错误代价巨大),公司通常会让 AI 通过一个“演示门槛”(Demonstration Bar)。这个门槛很低:AI 只需要在一次文档处理中答对一次即可。研究发现,57 出 72 种不同的 AI 设置都通过了这个简单的测试。看起来像是一场胜利!
但随后,论文提出了“生产门槛”(Production Bar)。这是真正的考验。要跨越这个门槛,AI 必须:
- 每次都能做到 99% 的正确率。
- 如果你问同样的问题两次,它必须给出完全相同的答案。
- 完美地引用其来源(准确展示它在哪里找到了信息)。
- 提供一个真正有意义的置信度信号(告诉人类:“我有 90% 的把握这是正确的”或“我在瞎猜”)。
当研究人员用这个更难的门槛来测试同样的 AI 设置时,结果令人震惊。只有 32 出 72 种配置达标。这意味着,那些看起来完美的 AI 工具中,有 43.9% 在被要求执行实际工作时彻底失败了。“魔术表演”在灯光亮起、观众近距离观察时失效了。
检查的成本:为什么“正确”还不够
这是论文中最令人惊讶的部分。即使一个 AI 基本上是正确的,如果人类必须检查它的每一项工作,它可能仍然是没用的。
研究人员测量了“审核负担”(Review Burden)。想象人类审核员是一个守门人。如果 AI 说:“我 99% 确定这是正确的,”守门人可能会跳过检查。但如果 AI 对自己的确定程度只字不提,守门人就必须检查 100% 的产出。
研究测试了三种构建这些工具的方法:
- 基础工具 (C1): 只执行任务。结果?它不提供置信度信号。人类必须检查 100% 的输出。这就像雇佣了一个从不说话的机器人,所以你必须阅读它打出的每一个字。
- 受控工具 (C2): 该工具被强制要求展示其推导过程并说明其置信度。结果?人类只需要检查 49% 的输出。这是一个巨大的胜利!该工具并不一定更准确,但它能告诉人类哪些部分是可以忽略的安全区域。
- 验证型工具 (C3): 该工具执行任务,然后重新阅读自己的工作以修正错误。你可能认为这是最好的方案。但研究发现,它实际上是最糟糕的选择。它的运行时间比之前慢了 2.3 倍,而且它仅将检查率降低到了 44%。更糟的是,它是唯一一个未能将错误率维持在足够低水平的设置。
“对账”带来的惊喜
论文中一个非常生动的例子涉及到一个名为“对账”(Reconciliation)的任务。想象你有两份数字列表(比如银行余额),你需要查看它们是否匹配。
- 一个 AI 模型(开源模型 A)在演示中表现惊人。它能识别出是否存在差异。
- 但当研究人员要求它说明数字相差了多少时,它基本上是在瞎猜。在这个特定任务上,它的正确率仅为 31.9%,尽管它在其他任务上表现出色。
这证明了一个工具可能只是个“只会一招的单项冠军”。它可能通过演示,因为它能发现问题,但在生产测试中失败,因为它无法计算出解决方案。
这对未来意味着什么
论文以一个简单但强有力的思维转变作为总结。
- 不要只问: “它有多频繁地答对?”
- 相反要问: “它知道自己什么时候错了吗?它能展示它的作业吗?人类还需要检查它的多少工作量?”
研究表明,衡量 AI 价值的标准不仅在于它有多聪明,还在于它能在多大程度上减轻人类进行枯燥、重复性检查的工作量。如果 AI 不能告诉你它何时不确定,你就必须检查所有内容,而这会耗费太多的时间和金钱。
研究人员谨慎地指出,这只是“初步测量”,现实世界的文档比他们测试的要复杂得多,因此问题在现实中可能会更加严重。但传达的信息很明确:在我们让 AI 进入真实世界之前,我们需要停止关注“魔术表演”,开始检查数学逻辑、来源和置信度。因为归根结底,一个虽然正确率达 99% 但却让你必须检查 100% 工作的工具,只不过是一个非常昂贵且缓慢的打字机而已。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。