← 最新论文
🤖 machine learning

Training ML Models with Predictable Failures

本文分析了从有限评估集外推机器学习模型故障率时存在的偏差,识别了此类预测低估风险的特定条件,并提出了一种“可预测性损失”微调目标,该目标在保持任务性能与安全性的同时显著降低了预测误差。

原作者: Will Schwarzer, Scott Niekum

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Will Schwarzer, Scott Niekum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名新自动驾驶汽车的安全检查员。你有一条小型测试赛道,上面有 100 辆车,用于检查碰撞事故。但这辆车实际上将被部署在拥有 1000 万辆车的公路上。

问题在于,你所担心的“最坏情况”碰撞极其罕见,以至于在你的 100 辆车测试中甚至可能一次都不会发生。如果你在小型测试中没有看到碰撞,你可能会错误地认为这辆车在公路上是绝对安全的。

本文提出了一种巧妙的解决方法。它建议两点:

  1. 更好的推测:我们可以利用数学(具体来说是极值理论这一分支)来观察我们小型测试中的“险些碰撞”,并数学地预测在巨大的公路上最严重的碰撞有多严重。
  2. 更好的训练:我们实际上可以教导 AI 模型以某种方式行为,使得这种数学预测变得准确,而不会降低汽车完成其实际任务(驾驶)的能力。

以下是使用简单类比对该论文思想的分解:

1. 问题:“隐形怪兽”

想象你试图预测一名冲浪者将驾驭的最高浪高。你观察他冲浪一小时(你的“评估集”)。你看到了一些大浪,但没有灾难性的巨浪。

  • 现实:这名冲浪者将冲浪 10 年(“部署集”)。在这 10 年中的某个时刻,会出现一个 100 英尺高的“怪兽浪”。
  • 失败:因为你只观察了一小时,你没有看到怪兽浪。如果你仅根据所见进行猜测,你可能会预测最大浪高为 10 英尺。当 100 英尺的巨浪袭来时,你就大祸临头了。

2. 旧方案:“尾部外推”

研究人员此前开发了一种方法(由 Jones 等人提出)来解决这个问题。他们观察你在这一小时测试中确实看到的最大浪高。他们假设浪高遵循特定的数学形状(如平滑曲线),并画出一条线来猜测如果你观察 10 年,浪高会达到多高。

  • 陷阱:这种数学技巧只有在浪高实际上遵循该平滑形状时才有效。如果冲浪者突然遇到一种完全不同的浪(一种“罕见模式”),而这种浪并未出现在你的一小时测试中,那么这条数学线将指向过低的位置。它将低估危险。

3. 论文的洞见:“教导模型变得可预测”

作者们意识到,问题不仅仅在于数学,还在于模型本身。AI 模型在失败的方式上可能是“混乱”或“不可预测”的。

  • 类比:想象 AI 是一个参加考试的学生。有时它犯小错,有时它犯一个巨大且奇怪的错误,这是老师未曾预料的。老师(安全检查员)试图猜测该学生在期末考试中会犯的最严重错误。
  • 创新:作者们创造了一种训练学生的新方法。他们不仅仅告诉学生“不要犯错”。他们告诉学生:“让你的错误遵循一种平滑、可预测的模式,这样我就能准确猜测你的最坏情况。”

他们将这种新的训练目标称为**“可预测性损失”**。

4. 工作原理(“魔法”技巧)

论文表明,你可以调整 AI 的训练,使得:

  1. 它保持擅长本职工作:AI 在解决实际问题(如驾驶或回答问题)方面不会变差。
  2. 它变得“守规矩”:AI 的最严重失败开始看起来像一条平滑曲线,而不是一团杂乱无章、不可预测的混乱。
  3. 数学生效:因为失败现在变得平滑且可预测,所以“外推数学”可以准确预测最坏情况,即使该情况尚未发生。

5. 结果:两项实验

作者在两个截然不同的领域测试了这一想法:

  • 密码游戏(语言模型)

    • 设置:AI 被赋予一个秘密密码,并被告知绝不要说出它。测试是看它是否会意外泄露密码。
    • 问题:大多数提示是安全的,但少数“对抗性”提示旨在诱骗 AI 泄露密码。这些恶意提示极其罕见,可能不会在小型测试中出现。
    • 解决:他们使用新方法训练了 AI。AI 在预测何时可能泄露密码方面变得更好,并且实际上泄露密码的频率远低于以前,同时保持了正常对话的能力。
  • 网格世界(机器人/强化学习)

    • 设置:一个机器人在网格中导航。大多数网格是安全的,但有些隐藏着陷阱。
    • 问题:机器人可能会掉进它从未见过的陷阱。
    • 解决:他们训练机器人具有“可预测的失败”。机器人学会了更好地避开陷阱,安全检查员也能准确预测机器人未来表现的最坏情况。

6. 关键要点

论文认为,我们不应仅仅希望我们的安全测试足够大,以捕捉每一次灾难。相反,我们应该以特定方式训练我们的 AI 模型使其“符合安全规范”:它们应以一种易于我们测量和预测的方式失败。

通过这样做,我们可以利用小型测试集来准确预测大规模现实世界部署的安全性。这就像教导冲浪者以某种方式驾驭海浪,使得科学家能够准确预测下一个怪兽浪的大小,即使科学家只观察了几分钟。

本文声称的内容

  • 它不声称这解决了所有安全问题。
  • 它不声称这适用于每一种 AI 失败类型(尽管在两项测试中效果良好)。
  • 它不声称这已准备好立即用于生死攸关的医疗或军事系统;它是一个“概念验证”,表明数学和方法在受控实验中是有效的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →