← 最新论文
💬 NLP

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE 是一种师生框架,它通过利用引导损失和难度估计自适应地剪枝冗余令牌,从而加速多模态大语言模型的训练,在显著降低总令牌消耗的同时实现更快的收敛和更优越的性能。

原作者: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个非常聪明的机器人理解视频。目前,标准做法就像强迫机器人阅读剧本中的每一个字,包括像“的”、“是”或“和”这样枯燥无味的词,同时它还在观看电影。这极其缓慢、昂贵,并且浪费大量能源,因为机器人正在做不必要的工作。

这篇论文介绍了一种名为REGATE(参考引导的自适应令牌省略)的新方法。你可以将 REGATE 想象成一位超级高效的学习教练,它通过告诉机器人应该专注于哪些词、跳过哪些词,来帮助机器人更快地学习。

以下是其工作原理,使用简单的类比说明:

1. 问题:阅读整个剧本

在旧方法(标准训练)中,机器人会处理视频描述中的每一个“令牌”(文本块)。

  • 类比:想象你试图通过阅读一本书来学习一门新语言,但书中每一个字都被明亮的霓虹灯高亮显示。你花费数小时盯着像“的”和“一”这样的常见词,它们实际上并不能教你太多关于故事的内容。你会感到疲惫,学习进度也会变慢。

2. 解决方案:“老师”与“学生”

REGATE 使用一个两人团队:

  • 学生:这是我们要训练的主要机器人模型。它同时查看视频和文本。
  • 老师:这是一个“冻结”(不变)的机器人版本,它能看到文本。它无法看到视频。

它们如何协同工作
老师查看一个句子并问道:“仅通过阅读文本,不看视频,我能猜出这个词的意思吗?”

  • 如果词是“的”或“是”,老师说:“简单!我知道这个。”
  • 如果词是“红色”、“旋转”或“混合”,老师说:“哇,不看图片我猜不到这个词!这个词需要视频。”

3. “难度分数”

REGATE 将老师的猜测与学生的自身历史相结合。

  • 类比:想象学生正在参加一场模拟测试。REGATE 会记录学生反复答错的问题。
  • 如果老师说:“这个词你需要看视频”,并且学生之前一直在类似词汇上遇到困难,REGATE 就会将该词标记为"高优先级"。
  • 如果老师说:“我知道这个词”,而学生已经掌握了它,REGATE 就会将其标记为"跳过"。

4. 结果:“智能跳过”

在训练过程中,REGATE 会创建一个掩码。它告诉机器人:“阅读这些重要的词,但跳过那些枯燥的词。”

  • 类比:机器人不再逐页通读整本书,而是只阅读那些真正推动故事发展的加亮句子。它忽略了填充词。
  • 好处:机器人减少了 40% 的工作量(处理的令牌更少),但学习效果一样好,甚至更好,因为它没有将精力浪费在已经知道的事情上。

论文声称的结果

作者在三种不同类型的视频学习机器人上测试了这种方法:

  1. VideoChat2
  2. VideoLLaMA2
  3. InternVL3.5

他们发现:

  • 速度:机器人达到峰值性能的速度是平时的两倍
  • 效率:与标准方法相比,它们仅使用了38% 的令牌(词/块)。
  • 准确性:在许多情况下,使用 REGATE 训练的机器人实际上比用旧方法训练的机器人更聪明,特别是在处理复杂的视频问题时。
  • 无额外成本:这种方法不需要构建新机器人或添加额外部件;它只是改变了机器人在训练期间如何阅读

总结

REGATE 就像是一个用于训练 AI 的智能过滤器。它不是让 AI 阅读剧本中的每一个字,而是利用一位“仅文本”专家来识别哪些词实际上需要视频上下文才能被理解。通过跳过简单、冗余的词,AI 学得更快,耗电更少,并且往往比阅读所有内容后变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →