Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation
本文介绍了电路微调(Circuit Fine-Tuning, CFT),这是一个计算高效的框架,它利用带有近零初始化探针头的电路发现技术来识别并仅微调视觉 Transformer 中最相关的子图,从而在不增加任何参数或推理开销的情况下,实现比参数高效基准模型显著更快的峰值精度提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超级聪明的机器人大脑,它已经读遍了图书馆里的几乎每一本书。它已经完美掌握了如何识别猫、汽车和云朵。但现在,你想教它一个新技巧:识别一种特定类型的稀有蘑菇。过去的方法是打开整个大脑,重新训练每一个神经元来学习关于蘑菇的知识。这种方法效果很好,但就像为了改变一扇窗户的颜色而试图重新粉刷整座摩天大楼一样——它耗时极长,耗费巨额电费,而且是非常浪费精力的做法。
科学家们最近尝试了一种名为“参数高效微调”(Parameter-Efficient Fine-Tuning, PEFT)的捷径。其核心思想是:“为什么要重新粉刷整栋建筑?我们只需贴上一些新的贴纸,或者微调极小比例的油漆即可。”这节省了改变“数量”上的成本,但有一个隐患:即使你只改变了大脑的 3%,计算机仍然需要让整个大脑进行数百轮的演练才能掌握这项技能。这就像开着一辆只有一个轮子在转向的赛车;你依然在以全速消耗燃油,只是转向幅度变小了而已。于是,一个大问题出现了:我们能否通过找出大脑中究竟哪些部分真正需要学习这个新技巧,并让其余部分保持不动,从而停止浪费时间和电力?
这就是新论文《电路微调》(Circuit Fine-Tuning, CFT)所要解决的问题。作者 Uri Z. Kialy 和 Gil Ben-Artzi 提出了一种巧妙的新方法来使这些巨型 AI 模型实现适配。他们并没有采用“猜测哪些部分需要微调”或“仅仅添加新贴纸”的方法,而是使用一种叫做“电路发现”(circuit discovery)的技术,去寻找 AI 内部已经擅长处理新任务的特定隐藏路径。
这就是其中的魔术技巧:在 AI 开始学习新任务之前,研究人员先给它进行一次“近零”(near-zero)测试。想象一下,你给 AI 一张空白画布,然后问它:“如果我现在给你看一个蘑菇,你的大脑中哪些部分会亮起来?”因为测试设置得让 AI 此时还没有强烈的观点,所以它揭示了大脑处理该特定类型图像时所使用的原始、自然的路径。研究人员随后绘制出这个“电路”——即 AI 网络中的一个特定子图(subgraph),并冻结其他所有部分。他们只允许这些预先识别出的特定部分进行学习。
结果非常惊人。其他方法可能需要让 AI 进行 44 到 96 轮(epochs)的训练才能达到巅峰性能,而这种新方法在大约 20 轮左右就能进入佳境。这是一个巨大的差异。就原始计算能力而言,CFT 使用的能量(以训练 FLOPs 衡量)减少了 2.3 到 6.6 倍,且实际运行时间缩短了高达 16 倍。最棒的是,它不会为 AI 添加任何新部件,也不会在以后实际使用时让它变慢。这就像意识到你不需要重建引擎就能赢得比赛;你只需要知道该切换哪些齿轮。
研究人员在各种挑战中测试了这一方法,从标准的图像数据集到复杂的医学 X 光片,甚至是一个视觉-语言模型(一种能看懂并能说话的 AI)。在几乎所有案例中,CFT 都以极小的代价达到了排行榜顶端。他们发现,不同任务所需的“电路”是独特的;识别鸟类的路径与识别肿瘤的路径完全不同。这证明了旧有的“仅仅微调一些随机部分”的想法并不是最高效的方式。通过在训练开始前倾听 AI 对数据的自然反应,CFT 展示了我们如何能够更聪明、更快、更少浪费地进行训练。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。