← 最新论文
💻 computer science

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

本文提出了一种无需超参数的双软提示微调(DSPT)方法,该方法通过序列概率归一化利用内在梯度抑制,自然地过滤掉来自错误标注样本的极端更新,从而鲁棒地使视觉 - 语言模型适应标签噪声。

原作者: Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《视觉 - 语言模型中标签噪声提示调优的内在梯度抑制》的通俗解释,辅以生动的类比。

大局观:用一本糟糕的教科书教导一位聪明的学生

想象你有一位名叫CLIP的聪明学生。这位学生已经阅读了数百万本书籍,看过数百万张图片,因此对世界已有大量了解。如果你给他看一张汽车图片并问:“这是汽车还是狗?”他通常能仅凭现有知识(这被称为零样本学习)就猜对。

然而,有时你想教这位学生一项特定的新技巧,比如识别某种非常具体的复古汽车。为此,你不需要重新教授所有内容,只需给他一些“提示词”(称为Prompts)来帮他聚焦。这个过程被称为提示调优(Prompt Tuning)

问题所在:糟糕的教科书
通常,你使用一本每张图片都标有正确标签的教科书来教导学生。但在这篇论文中,作者设想了一种教科书充满拼写错误和谎言(标签噪声)的场景。

  • 场景:你给学生看一张汽车的图片,但教科书上写着:“这是一只。”
  • 反应:因为学生非常聪明,他立刻意识到:“等等,这肯定是一辆车,不是狗!”他对自己的知识非常有信心。
  • 灾难:在标准教学方法中,当学生很自信但老师坚持说他是错的时,学生会受到巨大的“惩罚”(巨大的数学梯度)。学生会想:“好吧,老师这么确定,我一定错了”,于是他们疯狂地试图忘掉自己知道的东西,去迎合这个谎言。
  • 结果:学生变得困惑,忘记了自己原本的知识,表现甚至不如在没有帮助的情况下随意猜测。

解决方案:“双重 Softmax"过滤器

作者提出了一种名为双重 Softmax 提示调优(DSPT)的新教学方法。他们认为,既然学生(CLIP)已经很聪明,我们就应该保守行事。我们不应让老师的错误迫使学生过快改变想法。

以下是他们方法的工作原理,使用类比说明:

1. “双重检查”(过滤器)
想象学生举手回答问题。

  • 标准方法:老师查看答案,发现它与教科书不匹配,立即在桌上重重地敲下巨大的法槌(巨大的梯度)。
  • DSPT 方法:在老师敲下法槌之前,答案会经过一个双重 Softmax 过滤器。这就像是为老师的反馈配备了一副特殊的降噪耳机。

2. 过滤器如何工作

  • 对于说谎者(噪声样本):当学生 100% 确定那是汽车,但教科书说是“狗”时,过滤器意识到:“这是一个巨大的不匹配。”它不让老师对学生大喊大叫,而是将老师的声音静音。它将巨大的惩罚降低到几乎为零。学生忽略谎言,保留其原始知识。
  • 对于说真话者(干净样本):当学生不确定(也许是一辆模糊的汽车)且教科书说是“汽车”时,过滤器让老师的声音通过,但声音柔和。它允许学生学习有用的新细节,而不会被压垮。

3. “饱和区”
论文称此为“自适应饱和区”。这就像汽车上的减震器

  • 如果你遇到一个小颠簸(一个小的学习机会),汽车行驶平稳。
  • 如果你遇到一个大坑(来自噪声标签的巨大错误),减震器会剧烈压缩,使汽车不会剧烈弹跳。它吸收了冲击,防止汽车(模型)发生碰撞。

为何这很特别

大多数其他方法试图通过添加复杂规则或要求人类调整许多旋钮(超参数)来决定惩罚学生的程度来解决这个问题。

  • 论文的主张:他们的方法是自动的。它不需要调整任何旋钮。由于他们使用的数学方法(双重 Softmax),它自然发生。
  • 结果:在他们的实验中,即使教科书有 80% 的错误,这种简单的方法也能让学生保持良好表现。而其他方法则导致学生的表现比盲目猜测还要差。

类比总结

  • CLIP 模型:一位拥有强大记忆的聪明学生。
  • 标签噪声:一本充满随机错误答案的教科书。
  • 标准训练:学生被错误答案吓到,忘记了一切,表现糟糕。
  • DSPT(双重 Softmax):一个聪明的过滤器,它意识到“学生是对的,书是错的”,并屏蔽了书本的坏建议,让学生只从好的建议中学习。

作者证明,通过将通常被视为坏事的“梯度消失”(信号变得太弱)转化为一种特性,他们创造了一个盾牌,保护模型免受谎言学习的影响。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →