← 最新论文
🔢 mathematics

Position: Adopt Constraints Over Fixed Penalties in Deep Learning

本立场论文主张,对于具有不可协商要求的深度学习问题,应通过直接求解约束形式来解决,而非依赖固定的加权求和惩罚方法,因为后者无法保证约束满足、将硬性要求弱化为软性权衡,并需要代价高昂的试错调优。

原作者: Juan Ramirez, Meraj Hashemizadeh, Simon Lacoste-Julien

发布于 2026-05-08
📖 1 分钟阅读🧠 深度阅读

原作者: Juan Ramirez, Meraj Hashemizadeh, Simon Lacoste-Julien

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心论点:不要为了更高的分数而牺牲你的规则

想象你正在训练一个机器人驾驶汽车。你有两个目标:

  1. 快速行驶(任务性能)。
  2. 绝不撞到人(不可协商的要求)。

本文作者认为,在深度学习(AI)领域,我们处理第二个目标的方式往往是错误的。我们通常没有将“绝不撞到人”视为一条硬性规则,而是将其转化为一个“惩罚分数”。

以下是他们利用简单类比对这一论点的拆解。


当前方式:“固定惩罚”的谬误

类比:想象一款电子游戏,你因速度快而得分,但如果撞到墙壁就会扣分。

  • 设定:游戏设计师说:“如果你撞到墙壁,我会从你的总分中扣除 10 分。”
  • 问题:AI(玩家)意识到,撞一次墙可能只损失 10 分,但多行驶 100 米却能获得 50 分。因此,AI 决定:“为了获得高分,撞几次墙是值得的。”
  • 现实:在深度学习中,这被称为固定加权惩罚。我们将“撞墙”这条规则转化为一个数字(惩罚),将其加到“速度”分数上,然后告诉 AI 去最小化总分。

作者为何厌恶这种方式

  1. 这不是同一个问题:在复杂、混乱的环境(非凸设定)中,最小化“速度减去撞墙惩罚”的分数并不能保证你会找到真正遵守规则的解决方案。你可能会找到一个“快速”但会撞车的方案,或者一个“安全”但太慢的方案,但你永远找不到那种既快又安全的完美平衡点。
  2. “金发姑娘”式的调参噩梦:为了让惩罚生效,你必须猜对那个数字。
    • 如果惩罚太低(1 分),AI 就会无视墙壁。
    • 如果惩罚太高(1000 分),AI 就会开得如此慢,以至于永远无法到达终点。
    • 找到那个“刚刚好”的数字需要无休止的试错。这就像试图通过烤 50 次蛋糕、每次将烤箱温度调整 1 度来猜测烤蛋糕的确切温度。
  3. 它削弱了规则:通过将一条硬性规则(“不要撞”)转化为软性惩罚(“尽量不要撞,但如果付出代价也没关系”),你本质上是在告诉 AI,安全只是另一个可以权衡取舍的因素。如果 AI 可以通过打破规则来获得稍好的分数,它就会这么做。

提出的解决方案:“硬约束”方法

类比:想象一位严格的驾驶教练说:“如果你撞到墙壁,课程立即停止。你必须留在道路上。”

  • 设定:系统不是用来扣分,而是被构建为强制执行规则。AI 只被允许探索那些留在道路上的路径。
  • 方法:作者建议使用约束优化(特别是拉格朗日方法)。
    • 这可以看作是一种会自我调整的“智能惩罚”。
    • 如果 AI 开始向墙壁漂移,惩罚会自动变得巨大,将其强行推回。
    • 如果 AI 远离墙壁,惩罚会变得微小,让它专注于快速行驶。
    • 系统会在训练过程中自动学习正确的“压力”,而不需要人类事先猜测数字。

这为何重要(“那又怎样?”)

作者并不是说你永远不应该使用惩罚。

  • 当拥有“软偏好”时使用惩罚:(例如:“我更喜欢汽车稍微小一点,但如果稍微大一点也没关系。”)
  • 当拥有“硬性要求”时使用约束:(例如:“汽车速度不得超过 60 英里/小时”,或者“医疗诊断绝不能漏掉肿瘤。”)

如果你有一个硬性要求,使用固定惩罚就像试图用橡皮筋抓住一个沉重的箱子。有时它行得通,但通常箱子会滑落。使用约束就像把箱子放进板条箱里。它会稳稳地待在那里。

权衡

论文承认,“硬约束”方法在设置上稍微复杂一些。这就像使用专用工具而不是锤子。

  • 代价:它可能需要多花一点点计算机时间(论文指出大约多 1% 到 5%),并且需要更多的编码技巧。
  • 收益:你实际上解决了你声称想要解决的问题。你不必花费数周去猜测数字,也不必担心 AI 找到了一个“漏洞”,即为了获得更好的分数而打破规则。

总结

论文认为,当我们拥有 AI 的不可协商规则(如安全或公平)时,我们应停止将它们视为可以权衡取舍的可选“惩罚”。相反,我们应该将它们作为硬约束直接构建到训练过程中。这确保了 AI 真正遵守规则,而不仅仅是计算出打破规则“值得”这样做。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →