Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training
Lakestream 是一个专为大规模基础模型训练设计的无代理、原生对象存储数据平面,它引入了事务性全局批次和去中心化自适应提交算法,以提供类 ACID 的一致性、故障隔离以及高吞吐摄入能力,其延迟低于现有的消息队列或共置解决方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个巨大且超级聪明的机器人(大型基础模型)如何理解世界。为此,你需要将海量数据(如视频、图像和文本)以一个个“批次”的形式喂给它。
在过去,给这个机器人“喂食”就像工厂里的一条简单传送带。数据已经被预先打包进盒子,传送带只是以稳定的速度将它们运送到机器人面前。但现代人工智能截然不同。数据杂乱无章、体量巨大,且其大小取决于内部内容。有时,单个视频文件需要被解包并扩展为原来 1000 倍的大小,机器人才能使用它。
旧的传送带(现有系统)无法应对这种情况。它们要么堵塞,要么一旦有工人掉落一个盒子,整个工厂就会停摆。
Lakestream 登场:一种“智能、无中介”的数据平面。
本文的作者构建了一个名为Lakestream的新系统。可以将其视为一种为这些巨型 AI 模型组织数据交付的革命性方式。以下是其工作原理,通过简单的类比来说明:
1. 旧方法的弊端
- “共置”问题(健身房里的厨房): 想象机器人(训练者)正在举重,而为其准备食物的人(数据加载器)就站在同一个狭小的房间里。如果备餐时间过长,机器人就必须停止举重。如果备餐人员绊倒摔了一跤,机器人就会永远停摆。它们纠缠得太紧密了。
- “消息队列”问题(困惑的快递员): 想象使用一个中央邮局(如 Kafka)来递送数据。邮局将每一份文件都视为一封独立的信件。但机器人需要一次性获得完整的“一餐”(一个批次)。如果邮局将“鸡肉”部分在不同时间递送给机器人的一个手臂,而将“米饭”部分递送给另一个手臂,机器人就会感到困惑并学到错误的东西。此外,邮局是单点故障源;如果邮局局长生病了,就没人能吃到饭了。
2. Lakestream 的解决方案:共享数字仓库
Lakestream 摒弃了中央邮局和拥挤的厨房。相反,它利用了一个巨大的共享对象存储(就像一个无限大的数字仓库,例如 Amazon S3)和一个版本化清单(Master Ledger)。
以下是 Lakestream 使用的三个“魔法”:
A. “事务性全局批次”(完美的餐食)
在过去,数据只是一系列独立的记录流。Lakestream 将整个“批次”数据视为一个不可分割的单元,称为事务性全局批次(TGB)。
- 类比: 想象一位厨师准备了一整桌宴席。食物已经烹饪好并摆放在桌上,但被盖子盖住。盖子是锁着的。没人能看到食物。
- 魔法: 当厨师确定整桌宴席都准备好时,他们会操作主清单(Manifest)上的开关。突然间,盖子被揭开,所有机器人手臂在同一时刻看到了完整、完美的餐食。如果厨师在翻转开关前打翻了盘子,盖子就会保持关闭,没人会看到那堆混乱。这确保了每个人始终使用相同的数据。
B. “去中心化自适应提交”(智能红绿灯)
当许多厨师(生产者)试图同时更新主清单时,他们可能会尝试在同一页上写入,从而引发冲突。
- 旧方法: 他们会不停地敲门,直到有人让他们进去,这浪费了时间。
- Lakestream 方法(DAC): 厨师们拥有一种智能的、自我习得的节奏。他们观察清单的繁忙程度。如果清单变得巨大且更新变慢,他们在再次尝试写入前会自动多等待一小会儿。如果环境安静,他们就写得更快。他们无需互相交谈,只需观察清单即可。即使数百名厨师同时工作,这也能保持交通顺畅。
C. “检查点对齐的生命周期”(时间旅行保险箱)
AI 模型通常需要“保存进度”(检查点),并有时需要回退到之前的保存点以尝试不同的路径。
- 问题: 在旧系统中,一旦数据被“吃掉”,它就消失了。如果你需要回退,就无法实现。
- Lakestream 方法: 系统会保留每顿已供餐食的记录,并将其与机器人特定的“保存点”关联。当机器人保存进度时,它也会在清单中写入一个“水印”(安全线)。系统知道要将该线之前的所有数据保持安全无损。只有当它确认没有任何机器人保存点需要旧数据时,才会删除这些数据。这意味着你可以完美地回退时间而不会丢失数据,同时也不必为无人需要的数据存储付费。
3. 结果
该论文在 64 块强大的 GPU 上,使用巨大的视频和图像数据集对该系统进行了测试。
- 速度: 它比现有的最佳“共置”系统(数据准备和训练同时发生)快2.7 到 7.7 倍。
- 可靠性: 它处理故障的能力强得多。如果数据准备工人崩溃,机器人会继续训练而不会停摆。
- 效率: 它比使用中央消息队列(如 Kafka)快得多,后者难以跟上数据的规模和复杂性。
总结
Lakestream 就像用一条智能的、去中心化的公路系统取代了一条混乱的单行道。它利用共享仓库和主清单来确保:
- 每个人在同一时间获得完全相同的“批次”数据。
- 即使交通变得拥挤,系统也能保持快速运行。
- 你可以将训练过程回退到历史上的任何时间点,而不会丢失数据。
这一切都是在不需要中央管理者(中介)告诉每个人该做什么的情况下实现的,这使得它在训练世界上最大的 AI 模型时更快、更便宜、更可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。