← 最新论文
💻 computer science

Towards Auditing AI Systems in the Wild

该论文主张从静态的沙盒评估转向基于原则且具备不确定性感知能力的审计框架,通过在真实环境中对已部署的人工智能系统进行持续监测,以确保其符合不断变化的安全性与公平性约束。

原作者: Aditya T. Vadlamani, Anutam Srinivasan, Srinivasan Parthasarathy

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya T. Vadlamani, Anutam Srinivasan, Srinivasan Parthasarathy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你买了一辆高科技自动驾驶汽车。在购买之前,制造商向你展示了一段视频,显示这辆车在测试场阳光明媚的日子里行驶得非常完美。汽车通过了每一项测试。你感到很安全,于是决定购买。

但一旦你在真实的道路上驾驶它,情况就发生了变化。天气变得阴雨连绵,其他驾驶员的行为变得难以预测,汽车还遇到了它从未见过的施工区域。汽车可能会开始出现一些在测试场并不明显的奇怪错误。

这篇名为**《迈向对现实世界中 AI 系统的审计》(Towards Auditing AI Systems in the Wild)**的论文认为,我们不能仅仅在“测试场”(基准测试)中测试 AI,而是要开始在“真实道路”(现实世界)上持续观察它的行驶情况。

以下是使用简单类比对该论文论点的拆解:

1. 问题所在:“测试场” vs. “真实道路”

目前,公司测试 AI 系统就像是在封闭赛道上测试一辆新车。他们使用陈旧的、静态的数据(测试场)来观察模型是否有效。

  • 问题在于: 现实生活是混乱的。数据会发生变化(比如交通模式的变化)、用户行为会发生变化,以及会出现 AI 未经训练处理的新情况。
  • 结果: 一个 AI 在理论上可能看起来近乎完美,但一旦被数百万人在实际中使用时,它可能会失败或表现出不公平的行为。论文指出,我们正处于一场“竞赛”中,公司为了急于发布新 AI 而跳过了长期的安全性检查,试图赢得比赛,却冒着后期发生“碰撞”的风险。

2. 解决方案:持续的“交通监控”

作者提出了一种新的思考方式:AI 审计
与其在汽车离开工厂前进行一次性的检查,我们需要一个系统,在汽车每天行驶在路上时都对其进行监控。

  • 转变: 我们需要从“部署前测试”(在买车前检查汽车)转向“部署后审计”(在驾驶过程中检查汽车)。
  • 目标: 旨在发现诸如偏见(不公平性)、安全风险或错误等问题,且是在这些问题发生时,而不是在灾难发生之后。

3. 新方法:“风险控制”

论文建议我们应该将审计视为一种统计学上的风险管理游戏,而不仅仅是一个简单的及格/不及格测试。

  • 类比: 想象一个限速标志。在旧的方法中,你会检查汽车是否正好以 60 英里的时速行驶。在新的方法中,作者说:“我们无法在每一毫秒都精确知道车速,因为路面有雾(不确定性)。相反,让我们计算汽车超速的风险。”
  • 运作方式: 我们设定一个“风险预算”。如果 AI 开始表现出可能违反规则的行为(例如对特定群体不公平),系统就会计算这种情况发生的概率。如果风险过高,我们就进行干预。这使我们能够处理由于无法获得关于 AI 在现实世界中表现的完美信息而带来的问题。

4. 谁在监视?(不同的审计者)

论文指出,不同的人以不同的“视野”观察 AI:

  • 内部人员(白盒): 构建 AI 的公司拥有蓝图,可以看到引擎内部的一切。
  • 监管机构(灰盒): 政府机构可以查看引擎内部,但可能看不到秘密配方。
  • 公众/研究人员(黑盒): 普通人和外部科学家只能从外部观察汽车的行为(输入和输出)。他们必须根据汽车的表现来推测引擎是如何工作的。
  • 核心点: 没有一个人能看到全貌。我们需要所有这些群体协同工作,以获得 AI 安全性的全景视图。

5. 我们在审计什么?

论文列出了我们需要检查的六个方面,就像检查汽车的不同部件一样:

  1. 功能(Function): AI 是否真的在做它应该做的事情?
  2. 运行(Operations): 基础设施(道路和燃料管道)是否正常工作?
  3. 人机交互(Human-AI Interaction): 人类是否过度信任 AI 或使用了错误的方式?
  4. 安全与防护(Safety & Security): AI 是否正在被黑客攻击或被误导?
  5. 合规性(Compliance): AI 是否遵守法律?
  6. 宏观影响(Big Picture Impact): AI 是否随着时间的推移对社会造成了伤害(例如造成交通拥堵或传播虚假信息)?

6. 困难之处(挑战)

作者承认这很难,因为:

  • 我们没有完美的规则: 说“不要歧视”很容易,但很难写出一个数学规则,使其在每种情况下都能精确定义这意味着什么。
  • 数据是混乱的: 现实世界的数据是充满噪声且不完整的。
  • 人类是不可预测的: 当人类与 AI 协作时,很难判断错误是 AI 的错还是人类的错。

总结

论文得出结论:为了让 AI 值得信赖,我们不能再将其视为一个静态的产品,而应将其视为一个不断演进的生命系统。我们需要持续的、具备风险意识的监控,这种监控接受了我们无法掌握一切的事实,但能提供一种统计学上的手段,确保 AI 在现实世界中学习和变化时,依然保持安全和公平。

他们表示,成功不仅仅在于 AI 通过了一项测试;而在于拥有一个能够告诉我们:“这台 AI 有 5% 的概率即将违反安全规则”的系统,以便我们在造成伤害之前进行修复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →