Improving MLLM Training Efficiency via Stage-Aware Sparsity
该论文提出了稀疏训练方案(STS),这是一种阶段感知框架,通过在对齐阶段动态压缩视觉令牌并在指令微调阶段跳过冗余层,以应对不同来源的计算冗余,从而提升多模态大语言模型的训练效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教导一位才华横溢但极度饥饿的学生(即人工智能)去同时理解图片和文字。这位学生是一位“多模态大语言模型”(MLLM)。问题在于,教导这位学生极其昂贵且缓慢,因为该学生试图查看照片中的每一个像素,并阅读教科书中的每一层内容,即使其中大部分信息只是噪声或重复。
本文提出了一种名为STS(稀疏训练方案)的新训练方法。请将 STS 视为一种聪明的两阶段辅导策略,而非单一技巧,它会根据学生当前正在学习的内容调整其方法。
以下是其工作原理,通过简单的类比进行分解:
核心问题:“过多的噪声”
在训练这些人工智能模型时,有两件事极大地浪费了时间:
- 视觉冗余:一张照片可能包含 10,000 个像素,但其中 8,000 个只是蓝天或空白背景。人工智能在处理这片空白天空时浪费了能量。
- 层级冗余:人工智能拥有许多“思考层级”(就像书中的章节)。在训练初期,人工智能并不需要阅读每一章就能掌握基础知识。
本文认为,这些“浪费”的部分在学习的不同阶段并不相同。在开始时浪费时间的事物,与在结束时浪费时间的事物是不同的。
解决方案:两阶段辅导计划
作者设计了一个系统,根据训练阶段切换战术,就像教练根据运动员是在热身还是比赛而改变训练项目一样。
第一阶段:“照片过滤器”(模态对齐)
情境:在开始时,人工智能正在学习将图片与文字联系起来。人工智能的“语言”部分被冻结(它尚未学习新词汇),但它正淹没在过多的图片细节中。
类比:想象你正在向学生展示一部 4K 电影来解释一个故事。学生被海量的帧数弄得不知所措。
修正方案(视觉令牌压缩器):教练(STS)不使用整部电影,而是使用一个智能过滤器。它快速扫描图像并说道:“嘿,这部分只是蓝天,跳过它。这部分是人脸,保留它。”
- 它在人工智能甚至查看图像之前,就丢弃了图像中无聊且重复的部分。
- 这在开始时节省了巨大的能量。
第二阶段:“略读者”(指令微调)
情境:现在人工智能已经学会了如何看图,是时候学习如何遵循复杂指令并进行对话了。人工智能的“语言”部分现在已激活并正在学习。
类比:想象学生正在阅读一本厚重的教科书。起初,他们需要阅读每一个字来理解基础知识。但随着他们变得更聪明,他们开始意识到:“我已经掌握了第 1 章和第 2 章;我可以略读它们,专注于第 10 章中那些新的、棘手的内容。”
修正方案(层级动态跳过器):教练告诉人工智能:“对于这一特定课程,你不需要动用全部脑力。你可以跳过前几个‘思考层级’,直接跳转到更深层的层级。”
- 随着训练的推进和人工智能能力的提升,教练逐渐让他们再次阅读更多层级。
- 这阻止了人工智能在已经理解的事物上进行不必要的思维体操。
结果:更快、更精简,且依然聪明
本文在几种不同的人工智能模型上测试了这种“两阶段辅导”。以下是他们的发现:
- 巨大的节省:人工智能在训练过程中使用的计算能力(FLOPs)减少了约17%。这就像在少花 17% 的时间内完成马拉松。
- 智力无显著下降:尽管跳过了如此多的工作,人工智能的测试得分仍达到了如果完成所有工作所能获得分数的97% 至 99%。
- 平衡的方法:本文发现,如果仅使用“照片过滤器”或仅使用“略读者”,效果并不理想。你需要两种策略在正确的时间协同工作,才能获得速度与智能的最佳平衡。
一句话总结
本文指出:“不要将人工智能训练过程视为一段漫长而枯燥的跋涉。要将其视为一段拥有不同地形的旅程。当人工智能在看图片时,帮助它忽略背景噪声。当人工智能学习说话时,让它跳过它已经知道的章节。通过这样做,我们可以以更快的速度训练出超级聪明的人工智能模型,而不会让它们失去智慧。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。