← 最新论文
📈 economics

Scaling, Lock-In, and Proxy Compliance: A Political Economy of Responsible AI

本文提出了一个政治经济学模型,论证了转换成本和验证约束如何导致人工智能厂商通过仅满足可观测的审计阈值来达成“代理合规”,从而在实质性风险缓解不足的情况下进行操作,并提出了诸如独立审计、可移植性和结果挂钩的责任制等制度机制,以使激励机制与真正的安全性保持一致。

原作者: Florian A. D. Burnat, Brittany I. Davidson

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Florian A. D. Burnat, Brittany I. Davidson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一个巨大且繁忙的市场,各公司都在出售功能极其强大、却又隐形的机器人。这些机器人可以写故事、诊断疾病或驾驶汽车,但由于它们过于复杂,除了制造它们的公司的内部人员外,没有人能轻易看透其内部运作机制。这就是“算法审计”和“人工智能治理”的领域。长期以来,人们一直寄希望于只要公司承诺表现良好并展示出一些清单,这些机器人就会是安全的。但一群科学家和经济学家意识到,仅仅靠承诺是不够的;你需要证据。他们提出的重大问题是:为什么在机器人仍然会犯错的情况下,各公司仍不断展示出完美的清单?答案在于一种复杂的组合:更换不同机器人的难度、窥视机器人大脑的难度,以及卖出机器人的公司实际上对被抓包的恐惧程度。

这篇题为《规模化、锁定效应与代理合规》(Scaling, Lock-In, and Proxy Compliance)的论文深入探讨了这个谜题,并使用一个数学故事(模型)来解释为什么“看起来”负责往往比“实际”负责更容易。作者 Florian A. D. Burnat 和 Brittany I. Davidson 认为,我们正陷入一个被称为“代理合规”(proxy compliance)的陷阱。这种情况发生于:一家公司只做了足以通过基础检查(例如展示一份模型卡或安全清单)的工作,却并未真正解决导致伤害的深层、隐藏的问题。他们发现,这是因为一旦一家企业购买了一台机器人并围绕它构建了整个办公体系,日后要切换到另一台机器人的成本就会变得极其高昂且困难。这种“锁定效应”意味着买家无法在机器人表现不佳时以“离开”作为威胁。因为买家被困住了,他们便不再密切监视机器人。而因为买家不进行监视,机器人制造商便觉得只需完成最低限度的文书工作即可通过检查,即便机器人仍然具有危险性。

该论文使用了一个类似游戏的模拟过程,展示了这一过程是如何运作的。机器人制造商(供应商)选择隐藏或揭示多少关于其机器人的信息,以及投入多少精力使其安全。买家(部署者)则决定对机器人进行多少程度的监视。作者发现,如果买家被“锁定”(困在现有机器人上),他们就会减少监视。当监视减少时,机器人制造商就没有理由去真正修复机器人,因此他们只会在满足官方文书要求的基础上进行修复。其结果是,机器人虽然在纸面上看起来完美无瑕,但在现实生活中仍然存在风险。

然而,这篇论文也提供了一条出路。它建议,如果监管机构赋予独立专家无需经过公司许可即可窥视机器人“大脑”的权力,或者如果能让买家更容易地切换到其他机器人,权力的天平就会发生倾斜。如果买家知道自己可以离开,他们就会更密切地监视机器人,从而迫使制造商真正解决问题。作者还发现,如果公司应对机器人行为产生的“结果”承担法律责任(而非仅仅是是否填写了正确的表格),即使无人监视,他们也会被迫变得更加安全。

简而言之,这篇论文指出,“看起来很好”与“实际很好”之间的差距并非偶然;当规则允许公司钻空子时,这是公司的理性选择。解决方案不仅仅是更多的清单,而是改变规则,让公司无法躲在文书工作背后,并让买家不再被困在糟糕的机器人上。作者表明,通过结合适当的独立检查和更换供应商的自由,我们可以从“代理合规”转向真正的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →