VersaDB: A High-Performance AI Storage Database for Unifying Mutimodal Datasets
本文介绍了 VersaDB,这是一种旨在通过基于页面的存储系统、B+ 树索引和分层元数据管理来统一多模态 AI 数据集的、高性能数据库,与现有框架相比,其数据处理速度实现了高达 5.35 倍的加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界里,计算机正在通过学习海量的信息集合来学习如何看、听以及理解语言。这些被称为数据集的信息集合,是驱动这些数字大脑的燃料。正如汽车没有汽油就无法行驶一样,AI 模型如果没有数据就无法学习。然而,这些数据以多种不同的形式存在:有些是文本,有些是图像,有些是音频,还有些是这三者的复杂混合体。长期以来,研究人员一直在努力解决如何快速存储和检索这些多样化信息的问题,以跟上现代计算机芯片的速度。随着这些芯片变得越来越快,仅仅是加载数据所需的时间已经成为了瓶颈,拖慢了整个学习过程。挑战不仅在于信息的容量,还在于不同类型的数据通常以不兼容的方式存储,迫使计算机浪费时间进行转换和搜索它们所需的内容。
为了解决这个问题,一个研究团队开发了一个名为 VersaDB 的新系统,这是一个专门为人工智能数据的混乱且多变特性而设计的专用存储库。研究人员发现,现有的方法通常是为单一类型的数据或特定的软件而构建的,在面对现代 AI 训练的混合现实时效率低下。他们创建了一个系统,将结构化信息(如标签和数字)与非结构化信息(如原始图像或声波)区别对待。通过将这两类数据分别存放在同一个存储文件内的不同部分,该系统可以以一种让查找和使用速度更快的方式来组织它们。团队构建了一个类似于高度组织化的图书馆的结构,在这里每一件信息都有一个精确的位置,并且有一个单独的地图,允许计算机直接跳转到正确的位置,而无需先阅读其他所有内容。
研究人员使用各种各样的真实世界数据集对这个新系统进行了测试,包括数百万张图像、庞大的文本库和数小时的音频录音。他们在两种不同类型的强大计算机上运行了这些测试,以确保结果的稳健性。研究结果表明,VersaDB 可以显著加快向 AI 模型喂送数据的过程。在许多情况下,新系统加载和准备数据的速度比之前的最佳方法快了多达 5.35 倍。这种提速并非偶然现象;无论研究人员是使用单个计算机线程,还是将工作分配给多个处理器同时进行,该系统都保持了这一优势。该系统还表现出极高的灵活性,能够处理从简单的文本文件到结合了视频和音频的复杂多模态数据集,且不会损失效率。
除了纯粹的速度之外,研究人员还发现,他们的新系统在利用计算机内存方面通常更加聪明,特别是在 x86-64 架构上,它比竞争对手所需的内存要少得多,有时使用的空间甚至不到其他系统所需空间的一半。然而,研究也指出,在 AARCH64 架构上,VersaDB 在处理音频和自然语言处理(NLP)数据集时,其内存消耗高于现有解决方案。这种效率至关重要,因为它允许研究人员在相同的硬件上处理更大的数据集,从而可能节省资金和能源。该系统通过采用一种动态方法来管理内存,仅将最频繁需要的信息保持在易于获取的状态,并在空间紧张时丢弃其余部分。这使得计算机能够专注于正在使用的数据,而不是同时持有所有数据。
VersaDB 的设计还解决了数据管理中的一个常见问题:一旦数据被存储,就无法轻松地更新或修改数据。与通常要求研究人员在更改单个信息时必须重建整个文件的传统存储格式不同,VersaDB 专门设计用于克服这一限制。该系统实现了一个分层锁管理器和基于页面的存储架构,能够实现更细粒度的锁定,允许在不影响写入操作的情况下进行读取。这意味着,不像以往的方法在修改数据时需要重新生成整个文件,VersaDB 支持动态字段扩展和多样化数据的无缝集成,提供了一种更灵活的数据管理方式。
最后,这篇论文所呈现的工作表明,我们存储数据的方式与我们用来学习的算法同样重要。通过重新思考信息保存和访问的基本结构,研究人员消除了阻碍更快 AI 训练的一个重大障碍。结果表明,VersaDB 为当前标准提供了一个可靠且高性能的替代方案,能够适应人工智能数据集日益增长的复杂性。虽然该系统在处理特定类型的计算机硬件(特别是某些大型文本和音频数据集)时表现出性能和内存使用的变化,但它在大多数测试中始终优于现有解决方案。这项工作指向了一个未来,即 AI 系统可以学习得更快速、更高效,由一个与它所支持的模型一样智能且具有适应性的存储系统来驱动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。