← 最新论文
🤖 machine learning

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

本文介绍了 DeltaPrompts,这是一个包含 20 万个合成推理问题的数据集,由一个分阶段流水线生成,该流水线针对“零增量”提示(即教师模型与学生模型达成一致的情况),从而最大化学习信号,并在多种多模态蒸馏场景中实现高达 15% 的相对性能提升。

原作者: Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《DeltaPrompts:逃离多模态蒸馏中的零增量陷阱》的解释。

核心问题:“零增量”陷阱

想象你是一名学生,正试图向一位天才老师学习如何解决复杂的数学问题。你想通过观察老师解题,然后自己尝试解题来学习。这个过程被称为蒸馏

通常,研究人员只是抓取一大堆现有的数学问题(例如来自教科书)用于这种训练。但这篇论文的作者发现这种方法存在一个隐藏缺陷:大多数这些问题对学生来说太简单了。

他们将此称为**“零增量陷阱”**。

  • 场景:你给老师一个问题。老师解出答案。然后,你把完全相同的问题交给学生。
  • 陷阱:学生已经知道如何完美地解决这个问题。他们给出了与老师完全相同的答案。
  • 结果:因为学生和老师的回答 100% 一致,学生什么也没学到。这就像老师向一个昨天已经掌握该概念的学生解释一样。学生的大脑没有活跃起来;没有建立新的连接。

论文发现,在用于图表和文档推理的标准数据集中,高达 69% 的问题属于“零增量”问题。 学生和老师已经处于同一水平,因此用它们进行训练是浪费时间。即使你给学生提供 100 倍多的这类简单问题,他们也不会变得更聪明。

解决方案:测量“差距”(增量)

为了解决这个问题,作者提出了一条新规则:只有当老师和学生意见不一致时,问题才是有用的。

他们将这种分歧称为**“答案分歧”**(或增量,Δ\Delta)。

  • 高增量:老师用一种方式解题,而学生答错了(或猜得不同)。这是一个学习机会。学生意识到:“哦,我漏掉了那一步!”并从老师的纠正中学习。
  • 零增量:两人都答对了。没有发生学习。

论文认为,要制造一个智能的 AI,你需要的不是更多的数据,而是更好的数据——具体来说,是那些 AI 真正感到棘手的数据。

修复方案:构建“增量”数据集

由于现有的教科书充满了“零增量”问题,作者建立了一个新系统来创建他们自己的问题。他们将这个新数据集称为DELTAPROMPTS

以下是他们构建该数据集的三步法:

  1. 种子引导生成(草图):他们利用现有的问题,要求一个强大的 AI(“老师”)创建新的、更难的版本。这就像老师看着一道数学题说:“好吧,让我们让它稍微棘手一点。”
  2. 技能引导生成(目标):这是秘诀所在。系统会查看学生 AI 过去在哪里失败。它会问老师:“学生具体漏掉了什么技能?”(例如,“学生无法读取图表上的微小数字”)。然后,老师会生成一个问题,专门用于测试那个确切的薄弱技能。
  3. 拒绝过滤器(守门员):他们生成了数千个新问题。但在保留它们之前,他们会进行测试:“学生答错了而老师答对了吗?”
    • 如果(高增量):保留它。
    • 如果(零增量):扔掉它。

最终结果是一个包含200,000 个定制问题的数据集,其中学生肯定会遇到困难,从而确保最大程度的学习。

结果:为学生超级充电

作者在不同 AI 模型上测试了这个新数据集。结果令人印象深刻:

  • 巨大提升:即使是在训练一个已经非常聪明的 AI 模型时,使用 DELTAPROMPTS 相比使用标准数据集,其性能提升高达15%
  • 适用于新学生:他们将为一种类型的 AI 制作的问题,交给了完全不同类型的 AI。它仍然有效!这证明这些问题不仅仅是死记硬背特定答案;它们正在教授通用的推理技能。
  • 全面变强:AI 不仅在图表方面变得更好,在阅读文档和理解真实世界图像方面也变得更出色。

核心启示

论文得出结论:在教授 AI 时,瓶颈不在于拥有更多的数据,而在于拥有正确的数据。

类比:
如果你想健身,以 1 英里/小时的速度在跑步机上跑步(零增量)是帮不了你的,即使你跑 10 个小时。你需要以让你感到吃力但仍能坚持的速度跑步(高增量)。DELTAPROMPTS 就像一位私人教练,不断调整速度,确保你始终处于学习的“甜蜜点”,而不是让你在简单的问题上虚度光阴。

通过专注于 AI 已知内容与需要学习内容之间的差距,作者创造了一种更高效的方法来训练更智能、更小型的 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →