MinT: Managed Infrastructure for Training and Serving Millions of LLMs
MinT 是一个托管基础设施系统,通过保持单一大型基础模型常驻并动态管理轻量级适配器修订版,从而实现对数百万个基于 LoRA 的大语言模型策略的高效训练与服务,进而在密集架构和混合专家(MoE)架构中显著提升可扩展性、内存效率及部署速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你经营着一个庞大且极其昂贵的图书馆,里面藏书无数(即基础模型)。这些书籍体积巨大,占满整个房间,且极难搬运。
在旧有的做法中,如果你想让一本书掌握新技能——比如解决数学问题或撰写法律合同——你就必须复印整本书,将新笔记写在页边空白处,然后将这本全新且沉重的副本搬到另一个房间展示给人们。如果你想教授 1,000 种不同的技能,就需要 1,000 本沉重的书籍副本,这会占用巨大的空间,并在搬运过程中耗费大量时间。
MinT(MindLab 工具包) 改变了这一局面。MinT 不再搬运整本书,而是提出:“让我们把沉重的书籍原封不动地锁在图书馆里。我们只需将新技能写在轻便的小便签纸上(称为LoRA 适配器)。”
以下是 MinT 的工作原理,分解为三个核心概念:
1. “便签纸”系统(缩小规模)
你不再搬运一本重达 100 磅的百科全书,而只需移动一张重 1 盎司的便签纸。
- 旧方式:要更新模型,你必须将笔记合并回书中,生成一个新的庞大文件。保存和移动这个过程耗时极长。
- MinT 方式:你将沉重的书籍(基础模型)保留在计算机内存中。当你训练新技能时,只需保存那张微小的便签纸。
- 结果:移动“更新”变得极快。该研究发现,对于中等规模的模型,仅移动便签纸的速度比移动整本书快18 倍;对于巨型模型,则快了近3 倍。这就像发送一条短信,而不是邮寄一块砖头。
2. “切换站”系统(扩大规模)
想象你有一台巨大而复杂的机器(超级计算机),它一次只能容纳一本沉重的书籍。
- 问题:通常,如果你想训练 5 个不同的策略版本(例如,一个用于数学,一个用于编程,一个用于法律),你需要 5 台不同的机器,每台都存放着一本沉重的书籍副本。这是一种资金浪费。
- MinT 解决方案:MinT 充当智能交换台。它将沉重的书籍加载在机器中。当需要训练“数学”版本时,它换入“数学”便签纸;当需要“编程”时,它换出该便签纸并放入“编程”便签纸。
- 结果:你可以在同一台机器上训练许多不同的“策略”,而无需增加更多计算机。论文显示,这使得 40 亿参数模型的训练速度提高了1.77 倍,300 亿参数模型的训练速度提高了1.45 倍,且无需额外内存。
3. “智能目录”系统(扩展规模)
想象一个拥有百万张不同便签纸的图书馆,但你的阅读桌一次只能容纳几张。
- 问题:如果用户请求特定的便签纸,而它不在桌上,你就必须去储藏室找到它并取回。如果有 1,000 人同时请求 1,000 张不同的便签纸,储藏室就会堵塞,所有人都会排起长队等待。
- MinT 解决方案:MinT 将其组织成一种智能配送服务。
- 目录:它可以追踪一百万张不同的便签纸(策略)。
- 缓存:它将最热门的便签纸放在书桌旁的架子上(CPU 缓存),以便随时取用。
- “打包”技巧:有时,一张便签纸实际上是由成千上万个微小碎片组成的(像拼图一样)。MinT 在将它们送到书桌前,会将这些碎片粘合在一起,打包成一个整洁的包裹。这使得配送速度提高了8.5 倍,因为配送卡车不必为了拾取 37,000 个微小的拼图碎片而停车 37,000 次;它只需取走一个盒子。
全局视角
MinT 本质上是 AI 训练的管理者。它通过避免搬运巨型文件,防止你浪费时间和金钱。相反,它将沉重的“大脑”(基础模型)固定在一个位置,并管理附着在其上的成千上万个微小的“技能”(适配器)。
- 对于训练:它让你能够快速切换不同的技能,而无需重新加载整个大脑。
- 对于服务:它让你能够向用户提供服务数百万种不同的技能,仅加载该确切时刻所需的特定技能,并以不堵塞系统的方式完成。
简而言之:不要移动大象,只需移动鼠标。 MinT 使得在共享且昂贵的底层基础上运行数百万种不同的人工智能个性成为可能,而无需移动该底层基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。