← 最新论文
🤖 machine learning

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

本文提出了一种通过基于子集的归因约束来惩罚对偏离先验证据的依赖,从而使模型与人类先验对齐的训练方法,进而提升图像分类和 GUI 智能体任务中的任务准确性与决策合理性。

原作者: Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探的困境:为什么仅仅做对是不够的

想象一下,你正在教一个机器人识别猫。你给它看了一百万张猫的照片,最终,每当机器人看到一个毛茸茸的形状时,它都能非常熟练地发出“喵!”的声音。但问题在于:机器人其实并没有在观察猫的胡须或耳朵。相反,它学会了一个狡猾的捷径。它注意到在你所有的训练照片中,猫都坐在一块特定品牌的红色地毯上。于是,机器人完全忽略了猫本身,转而寻找那块红地毯。如果你给它看一只坐在蓝色沙发上的猫,它就会感到困惑;如果你给它看一张没有猫的红地毯,它可能仍然会大喊“喵!”。

这是人工智能领域一个常见的问题,特别是在被称为“机器学习”的一个分支中。科学家们构建这些“模型”来做决策,但模型经常通过寻找简单的模式(比如那块红地毯)而不是理解决策背后的真实原因(比如猫)来“作弊”。这是很危险的,因为如果机器人在驾驶汽车或点击屏幕上的按钮,它需要知道自己为什么这样做,而不仅仅是根据一次幸运的巧合进行猜测。为了解决这个问题,研究人员使用了“人类先验”(human priors)——这只是一个高级说法,意思就是“人类认为重要的东西”。如果一个人指着一只猫说,“看这里”,机器人也应该学会看向那里。但让机器人与人类达成一致是很困难的,因为机器人的大脑运作方式与我们截然不同。

论文的核心思想:“不要在不该学习的地方学习”

这篇题为《不要在不该学习的地方学习》(Where Not to Learn)的论文,通过一种巧妙的、选择性的训练方法来解决机器人作弊的问题。作者们建议,与其强迫机器人只能看正确的地方(这可能过于严苛并让机器人感到困惑),不如仅仅在它看错误地方时对其进行惩罚。

这就像一位老师在批改学生的作文。如果学生在错误的题目上写了一段精彩的论述,老师不会抹去整篇作文。相反,老师会在错误的部分画一个大大的红圈,并说:“这部分不属于这里。”学生随后就会学会将精力集中在正确的题目上。作者们称之为“先验对齐训练”(Prior-Aligned Training)。他们使用了一种名为“子集选择归因”(subset-selection attribution)的特殊工具,作为老师的放大镜。这个工具可以帮助机器人弄清楚究竟是图像或屏幕上的哪些微小部分促使它做出了决策。

以下是神奇之处是如何发生的:

  1. 放大镜: 该工具观察机器人的决策,并高亮显示它使用的前几个“线索”。
  2. 检查: 系统将这些线索与“人类先验”(即人类说重要的区域,例如按钮周围的边界框)进行比较。
  3. 温柔的引导: 如果机器人的首要线索位于人类的框内,系统会说:“做得好!”然后继续。但如果机器人的首要线索在框外(比如盯着红地毯而不是猫),系统就会施加惩罚。它告诉机器人:“停止依赖那个线索。”

论文明确反对了那些试图一次性“抑制”或压制所有非人类区域的旧方法。作者发现这种“硬性抑制”(hard suppression)过于粗暴;这就像是告诉学生除了答案以外不要思考任何事情,这往往会导致他们完全忘记如何解决问题。相反,他们的方法是“选择性的”。它只在机器人的最重要证据出错时才进行干预。如果机器人已经在看正确的地点,系统就会放手,让其他部分自由地做出贡献。

他们的发现:更聪明的机器人,更好的决策

研究人员在两个截然不同的领域测试了这个想法:

  1. 图像分类: 教计算机识别照片中的物体(如船只或动物)。
  2. GUI 智能体: 教 AI 在电脑屏幕上点击按钮(例如虚拟助手设置闹钟)。

在两种情况下,结果都非常理想。当他们使用这种“选择性惩罚”方法时,模型不仅在遵循规则方面表现得更好,而且在主要任务上也变得更出色了。

  • ImageNet-S 数据集(一组带有特定物体掩码的图像集合)上,他们的方法将 ViT 模型的准确率提高了 4.95 个百分点,并将 ResNet-101 模型的准确率提高了 1.74 个百分点
  • 更重要的是,决策的“合理性”得到了提升。他们使用“点游戏”(Point Game)来衡量这一点,该方法用于检查 AI 是否正在观察正确的物体。在 Saliency-Bench 数据集上,他们的方法将 ViT 模型的点游戏得分从 0.4363 提升到了 0.5463

论文指出,通过迫使 AI 依赖“正确”的证据(即人类先验区域),它会变得更加稳健。当他们用带有噪声、杂乱图像(在图片中添加随机静电噪声)测试这些模型时,使用该方法训练的模型比标准模型表现得更稳健。这暗示了通过阻止 AI 学习“作弊码”(如红地毯),它学会了依赖即使在混乱情况下也能发挥作用的稳定且有意义的特征。

作者还进行了“消融实验”(ablation studies),这就像拆解发动机以观察哪个部件起作用。他们发现,“偏差损失”(Deviation Loss,即对看错地方的惩罚)是核心驱动力,推动了准确性和合理性的主要提升。而“冗余损失”(Redundancy Loss,即防止 AI 过度依赖多个错误线索)对“合理性”得分的提升略有帮助,但对准确性的改变并不大。

简而言之,这篇论文表明,你不需要对 AI 的每一个想法进行微观管理。你只需要在它看向错误方向时抓住它,并温柔地将其引回正轨。这种方法不仅让 AI 对其决策的“原因”更加诚实,也让它在现实世界中更加准确和可靠。作者总结道,这种方法适用于各种类型的 AI,从简单的图像分类器到可以点击按钮并遵循指令的复杂“智能体”,这为开发既聪明又理性的 AI 指明了一条路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →