MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning
MuCRASP 是一种针对视觉语言模型的新型结构化剪枝框架,它通过识别并保护推理关键枢轴令牌以及解决跨模态激活差异,在保持多模态思维链推理准确性的同时,即使在较高压缩率下也优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢、多才多艺的助手,它极其擅长解决复杂的谜题。这位助手可以查看图片(例如一张凌乱房间的照片),并阅读问题(例如“如果我打翻花瓶,猫会湿吗?”)。为了回答,它不只是猜测,而是会写出一段逐步的思维日记,解释它是如何将各个线索联系起来的。这被称为**思维链(Chain-of-Thought, CoT)**推理。
然而,这位助手非常庞大。运行它需要占用大量的计算机内存和能量,导致成本过高,许多人无法在日常生活中使用它。
问题:“剪刀”式的错误
科学家们曾尝试通过“剪枝”来缩小这位助手的规模——即剔除他们认为未被使用的脑区部分。这就像园丁修剪一棵巨大的灌木,以便将其移入一个小花盆中。
以往方法的问题在于,它们就像一位蒙着眼睛使用剪刀的园丁。它们仅根据分支在总体上看起来有多“重”或有多“活跃”来进行裁剪,而并未理解这棵灌木实际上在做什么。
- 结果: 当它们为了缩小灌木而进行修剪时,却意外剪断了那些将逻辑步骤连接在一起的极其具体、微小的细枝。助手变得小巧且快速,却失去了逻辑推理能力。它仍能流利地说话,但其推理过程已支离破碎,就像一篇故事:每个句子单独看都通顺,但整体情节却毫无逻辑。
解决方案:µCRASP(聪明的园丁)
本文作者阿利特拉·杜塔(Aritra Dutta)和索马克·阿迪蒂亚(Somak Aditya)提出了一种名为µCRASP的新方法。µCRASP 并非蒙眼的园丁,而是一位懂得灌木具体任务——推理——的聪明园丁。
以下是µCRASP 的工作原理,通过三个简单的比喻来说明:
寻找“枢轴点”(转向灯):
在一条长长的推理链中,大多数词语只是填充内容。但有几个关键时刻,助手会从一种思维切换到下一种(例如,“我看到一个花瓶”→“因此,它可能会倒下”)。作者将这些称为枢轴标记(pivot tokens)。- 比喻: 想象一次火车旅程。大部分轨道只是直线。但道岔(火车变轨的地方)是最关键的部分。如果你在道岔处切断轨道,火车就会脱轨。µCRASP 会识别这些道岔,并拒绝切断它们,即使这意味着要切断更多笔直、枯燥的轨道。
尊重“双脑”系统(视觉 + 语言):
这位助手拥有两种截然不同的思维方式:一种用于观看图像(视觉),另一种用于阅读文字(语言)。这两个部分需要持续不断地相互沟通。- 比喻: 想象一个由两人组成的团队:一名摄影师和一名作家。他们必须合作解决一个谜团。旧的剪枝方法将他们视为一大团人并随机裁剪。µCRASP 则意识到,如果你切断了那些帮助摄影师与作家沟通的人,团队就会分崩离析。它会特别保护这两个大脑相互连接的“会议室”。
全局预算(背包):
目标是切除特定比例的脑区(例如 30%),以使其变小。- 比喻: 想象你有一个背包(计算机内存),需要装入大量装备。旧的方法可能会剪掉 30% 的重靴和 30% 的轻袜,结果导致你没有靴子却袜子太多。µCRASP 则像一个聪明的打包者。它会审视每个物品(神经元)相对于其“重量”的“价值”。它可能会决定保留沉重的靴子(因为它们对推理至关重要),而剪掉大量轻袜子,从而确保背包虽小,却功能完备。
结果
研究人员在多个不同的“助手”(AI 模型)上测试了该方法,发现:
- 旧方法会迅速破坏推理能力。一旦切除超过 25-30% 的模型,逻辑就会完全崩溃。
- µCRASP即使在切除**50%**的模型后,仍能保持逻辑完整。
- 尽管模型缩小了一半,它仍能解决复杂的视觉谜题(如物理问题或物体计数),其逻辑清晰度与庞大且昂贵的原始版本相当。
总结
µCRASP 是一种在不破坏 AI 大脑的前提下缩小智能 AI 模型的新方法。它通过仔细识别并保护 AI 从一种思维切换到下一种的那些微小而关键的瞬间,并确保 AI 的“眼睛”和“嘴巴”保持连接来实现这一目标。这使得强大的推理工具能够在更小、更便宜的计算机上运行,同时不丧失其逐步思考的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。