← 最新论文
🤖 AI

Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems

本文提出了一个通用框架,该框架利用反事实分析和高效估计量将责任归因于人工智能模型开发的特定阶段,从而在无需重新训练模型的情况下,实现对阶段效应的量化以及对伪相关性的消除。

原作者: Shichang Zhang, Hongzhe Du, Jiaqi W. Ma, Himabindu Lakkaraju

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Shichang Zhang, Hongzhe Du, Jiaqi W. Ma, Himabindu Lakkaraju

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在烘焙一个复杂的、多层结构的蛋糕。你不会把所有东西一次性混合在一起。首先,你要制作海绵蛋糕底(预训练)。然后,加入巧克力层(微调)。最后,抹上奶油霜并进行装饰(对齐)。

现在,想象蛋糕被端上桌,一位客人抱怨味道太甜了,或者有人喜欢巧克力却讨厌奶油霜。谁该承担责任?或者谁该获得荣誉?是制作海绵蛋糕的人?添加巧克力的人?还是装饰者?

这篇名为**《谁该获得荣誉或责备?》**的论文,正是针对人工智能领域探讨了这样一个问题。

问题所在:“黑盒”厨房

现代人工智能模型就像制作蛋糕一样,是分阶段构建的:

  1. 预训练: AI 从互联网中学习通用知识。
  2. 微调: 它学习特定的技能,例如识别医学图像或编写代码。
  3. 对齐: 它被教导要安全、礼貌且乐于助人。

当最终的 AI 出现错误(例如产生偏见)或取得成功(例如正确诊断疾病)时,很难说出究竟是哪个阶段导致了这一结果。这种偏见是源于最初的互联网数据?还是在微调过程中变得更严重的?目前的工具无法很好地回答这个问题,因为它们通常将整个模型视为一个巨大的整体,或者仅关注单个数据点,而忽略了“烘焙过程”(用于训练的数学方法和设置)是如何随时间改变模型的。

解决方案:一个“时空穿梭”侦探工具

作者创建了一种名为 AA-Score(问责归因分数)的新方法。你可以把它看作是一个针对 AI 训练的法医侦探工具。

为了避免每次为了观察跳过某一步会发生什么而重新烘焙整个蛋糕(这非常耗时),这个工具使用了一个巧妙的数学捷径。它提出了一个**“如果……会怎样?”**的问题:

“如果我们跳过了第二阶段(微调),今天的 AI 行为会是什么样子?”

为了在不重新训练的情况下回答这个问题,该工具会观察训练过程中留下的“足迹”。它追踪 AI 的内部设置(参数)在每一步中是如何变化的。它考虑了如下“配方细节”:

  • 学习率(Learning Rate): AI 每次从数据中“咬”下的步长有多大。
  • 动量(Momentum): AI 是在加速学习还是在减速学习。
  • 权重衰减(Weight Decay): AI 被迫简化其思维的程度。

通过分析这些足迹,AA-Score 可以估算出每个阶段对最终结果的贡献程度。

它是如何工作的:涟漪的比喻

想象向池塘中丢入一颗石子。石子就是一个训练步骤。涟漪就是 AI 大脑的变化。

  • 如果你在第一阶段丢下一颗石子,涟漪会一直传播到最后。
  • 如果你在第三阶段丢下一颗石子,涟漪就会较短。

AA-Score 计算这些涟漪的大小和方向。它汇总了在特定阶段丢下的所有石子所产生的涟漪,从而告诉你:“第二阶段对这一特定行为的贡献率为 60%。”

研究发现:抓捕“罪魁祸首”

研究人员在多项任务中测试了这个工具,发现它能够准确地定位责任:

  1. “嗜甜”偏见(伪相关):

    • 场景: 在一组人脸数据集中,AI 可能会学到“金发”等于“女性”,因为训练数据中大多数金发人士都是女性。这是一种“伪相关”(虚假连接)。
    • 结果: AA-Score 可以识别出究竟是哪个训练阶段教会了 AI 这个错误的教训。如果你随后“抹除”了那个特定阶段(通过在重测中跳过它),AI 就会停止犯这个错误。这有助于开发者从源头修复偏见。
  2. “坏食材”(噪声数据):

    • 场景: 假设一些训练照片的标签标错了(例如,把猫标记成了狗)。
    • 结果: 该工具会将处理这些错误标签的具体训练步骤标记为具有“负分”。它成功识别出了那些损害 AI 性能的“坏食材”。
  3. “新配方”(数据偏移):

    • 场景: 如果你用正常的照片训练 AI,然后突然切换到旋转过的照片,AI 可能会感到困惑。
    • 结果: 该工具显示,包含旋转照片的阶段对于识别旋转图像具有很高的正分,但对于识别正常图像则具有负分。这有助于解释为什么 AI 在学习新技能时可能会忘记旧技能(灾难性遗忘)。
  4. “秘密毒药”(后门攻击):

    • 场景: 黑客在训练数据中隐藏了恶意代码(比如一个微小的、不可见的触发器,使 AI 失效)。
    • 结果: 即使毒素被稀释并分布在许多步骤中,AA-Score 仍能检测出某些批次的数据对 AI 的安全性产生了负面影响。

为什么这很重要

目前,当 AI 失败时,开发者往往只能靠猜测。他们可能会重新训练整个模型,但这既昂贵又缓慢。这篇论文提供了一个实用的审计工具

  • 对于开发者: 这就像是一个质量控制检查员,可以指出工厂里哪台机器导致了缺陷,而不是关闭整个工厂。
  • 对于问责制: 它有助于将良好的表现(功劳)和不良的行为(责备)准确地归因于正确的开发阶段。

局限性(注意事项)

作者也诚实地说明了局限性:

  • 它是一种估算: 该工具使用数学近似值(泰勒展开)。对于最近的训练阶段,它非常准确;但如果训练过程非常混乱或不稳定,对于非常早期的阶段,准确度会降低。
  • 计算成本: 虽然它比重新训练快,但它仍然需要存储大量的训练数据(即“足迹”)。对于大规模 AI 模型,这可能需要大量的内存和计算能力。
  • 并非万能药: 该工具能告诉你“谁”负责,但它不会自动“修复”问题。人类仍需决定如何利用这些信息。

简而言之,这篇论文为我们提供了一种打开 AI 训练“黑盒”的方法,让我们能够看清旅程中的每一步是如何导向最终目的地的——无论那个目的地是成功还是失败。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →