ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
ReGATE 是一种师生框架,它通过利用引导损失和难度估计自适应地剪枝冗余令牌,从而加速多模态大语言模型的训练,在显著降低总令牌消耗的同时实现更快的收敛和更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个非常聪明的机器人理解视频。目前,标准做法就像强迫机器人阅读剧本中的每一个字,包括像“的”、“是”或“和”这样枯燥无味的词,同时它还在观看电影。这极其缓慢、昂贵,并且浪费大量能源,因为机器人正在做不必要的工作。
这篇论文介绍了一种名为REGATE(参考引导的自适应令牌省略)的新方法。你可以将 REGATE 想象成一位超级高效的学习教练,它通过告诉机器人应该专注于哪些词、跳过哪些词,来帮助机器人更快地学习。
以下是其工作原理,使用简单的类比说明:
1. 问题:阅读整个剧本
在旧方法(标准训练)中,机器人会处理视频描述中的每一个“令牌”(文本块)。
- 类比:想象你试图通过阅读一本书来学习一门新语言,但书中每一个字都被明亮的霓虹灯高亮显示。你花费数小时盯着像“的”和“一”这样的常见词,它们实际上并不能教你太多关于故事的内容。你会感到疲惫,学习进度也会变慢。
2. 解决方案:“老师”与“学生”
REGATE 使用一个两人团队:
- 学生:这是我们要训练的主要机器人模型。它同时查看视频和文本。
- 老师:这是一个“冻结”(不变)的机器人版本,它仅能看到文本。它无法看到视频。
它们如何协同工作:
老师查看一个句子并问道:“仅通过阅读文本,不看视频,我能猜出这个词的意思吗?”
- 如果词是“的”或“是”,老师说:“简单!我知道这个。”
- 如果词是“红色”、“旋转”或“混合”,老师说:“哇,不看图片我猜不到这个词!这个词需要视频。”
3. “难度分数”
REGATE 将老师的猜测与学生的自身历史相结合。
- 类比:想象学生正在参加一场模拟测试。REGATE 会记录学生反复答错的问题。
- 如果老师说:“这个词你需要看视频”,并且学生之前一直在类似词汇上遇到困难,REGATE 就会将该词标记为"高优先级"。
- 如果老师说:“我知道这个词”,而学生已经掌握了它,REGATE 就会将其标记为"跳过"。
4. 结果:“智能跳过”
在训练过程中,REGATE 会创建一个掩码。它告诉机器人:“阅读这些重要的词,但跳过那些枯燥的词。”
- 类比:机器人不再逐页通读整本书,而是只阅读那些真正推动故事发展的加亮句子。它忽略了填充词。
- 好处:机器人减少了 40% 的工作量(处理的令牌更少),但学习效果一样好,甚至更好,因为它没有将精力浪费在已经知道的事情上。
论文声称的结果
作者在三种不同类型的视频学习机器人上测试了这种方法:
- VideoChat2
- VideoLLaMA2
- InternVL3.5
他们发现:
- 速度:机器人达到峰值性能的速度是平时的两倍。
- 效率:与标准方法相比,它们仅使用了38% 的令牌(词/块)。
- 准确性:在许多情况下,使用 REGATE 训练的机器人实际上比用旧方法训练的机器人更聪明,特别是在处理复杂的视频问题时。
- 无额外成本:这种方法不需要构建新机器人或添加额外部件;它只是改变了机器人在训练期间如何阅读。
总结
REGATE 就像是一个用于训练 AI 的智能过滤器。它不是让 AI 阅读剧本中的每一个字,而是利用一位“仅文本”专家来识别哪些词实际上需要视频上下文才能被理解。通过跳过简单、冗余的词,AI 学得更快,耗电更少,并且往往比阅读所有内容后变得更聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。