RW-LoRA: Communication-Efficient Decentralized LoRA Fine-Tuning via Random Walks
本文提出了 RW-LoRA,一种通信高效的去中心化微调方法,该方法通过基于随机游走的单标记遍历来顺序更新模型,从而取代了全局同步和模型副本,在降低开销并避免聚合误差的同时,保持了具有竞争力的性能和严格的收敛保证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能领域,最强大的工具是被称为“基础模型”的海量计算机程序。这些系统通过对海量文本和数据的训练,能够以惊人的流利度撰写故事、翻译语言并回答复杂问题。然而,这些模型规模巨大,难以针对特定需求进行定制,例如将医疗助手调整为适应特定医院的记录,或将法律机器人调整为适应特定律所的历史。为了使它们实现适配,研究人员传统上使用一种称为“微调”的过程,即调整模型的内部设置以适应新数据。由于这些模型包含数十亿个设置,对其进行整体更新既昂贵又缓慢。为了解决这个问题,科学家们开发了一种称为“低秩自适应”(low-rank adaptation)的技术,它就像一个轻量级的插件。这种方法不是重写整个模型,而是添加一个小型且高效的新设置层来引导模型的行为,使得定制过程变得更快、更便宜。
挑战在于,当组织希望在不共享其私有数据的情况下进行这种定制时。在医疗或金融等领域,由于隐私法和安全方面的考量,数据不能被移动到中央服务器。相反,数据必须留在原地,而模型必须在多个相互通信的不同地点进行训练。现有的分布式训练方法通常依赖于一个中央协调器,或者要求每个地点不断与其邻居交换更新。这造成了信息的严重交通拥堵,并在尝试合并不同更新时引入误差。一种近期研究中详细介绍的新方法提供了一条不同的路径,它放弃了在网络中维护多个模型副本的想法。
研究人员提出了一种名为 RW-LoRA 的方法,它不将模型视为位于许多计算机上的静态对象,而是将其视为一个单一的、移动的“令牌”(token)。想象一位带着指令笔记本的信使,从一个办公室移动到另一个办公室。在这个系统中,模型从一个位置开始,学习那里的本地数据,然后物理性地移动到相邻的计算机,接着学习那里的数据。它继续这段旅程,以随机的模式在节点之间跳跃,在每一站积累知识。与其他需要所有计算机同时暂停并同步工作的算法不同,这种方法允许模型按顺序学习。信使携带模型的当前状态,利用本地信息对其进行更新,然后将其传递下去,从而消除了对中央管理者或频繁集体会议的需求。
团队使用一个标准语言模型和几个现实世界的语言任务(例如判断两个句子意思是否相同或对评论进行情感分类)测试了这个想法。他们将这种“移动模型”方法与依赖于邻居间不断交换更新的现有标准方法进行了对比。结果显示,这种“移动方法”达到了与传统方法几乎相同的准确度水平。在涉及句子分类和情感分析的任务中,新方法匹配了旧有更复杂系统的性能。然而,两者在效率上的差异非常显著。因为移动模型一次只发送一组指令,而不是向每个邻居广播更新,它大幅减少了在网络中传输的数据总量。在一项测试中,传统方法需要大约 54,000 次本地更新才能收敛,而移动方法仅用大约 25,000 次更新就达到了类似的结果,显著降低了通信和计算负荷。
研究人员还研究了模型“插件层”的大小如何影响结果。他们测试了不同规模的这些轻量级设置,范围从极小到中等大小,发现移动方法无论选择何种具体尺寸都保持稳健。这表明该方法具有灵活性,并不依赖于精确的配置即可良好运行。该研究提供了一个数学保证,证明即使在教学模型这一复杂且并非完全平滑的问题中,该方法最终也能找到一个良好的解。通过证明单个移动的模型可以在网络中有效地学习而不至于迷失或停滞,作者展示了去中心化训练并不一定需要进行混乱的数据交换。相反,一段简单的、顺序性的旅程同样可以行之有效,为在尊重现实世界隐私和带宽限制的同时训练强大的人工智能提供了一种切实可行的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。