← 最新论文
🤖 machine learning

LayoutBench: Performance Benchmarking of Cloud Storage Layouts for Multimedia Data

本文介绍了 LayoutBench,这是首个系统性评估不同云存储布局(独立对象、tar 归档文件和 Parquet 文件)如何影响多媒体数据检索性能与成本的基准测试,研究揭示了虽然 tar 归档文件在小规模查询中具有低延迟优势,但 Parquet 文件在大规模检索方面表现出色,尽管其产生的数据传输成本和内存需求显著更高。

原作者: Debopam Sanyal, Hongjie Chen, Alexey Tumanov, Joshua Kimball

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Debopam Sanyal, Hongjie Chen, Alexey Tumanov, Joshua Kimball

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一座位于云端的巨型数字图书馆,那里存储着数百万张照片、歌曲和视频,供计算机学习使用。这就是“云存储”的世界——一个数据居住在遥远服务器上的巨大仓库。但棘手之处在于:仅仅把书放在书架上并不意味着你能快速拿到它们。这些书在书架上的排列方式——是零散地摆放、整齐地堆叠在箱子里,还是被粘合在一起成为一本巨大的巨著——决定了一切。如果排列得一团糟,你的计算机就会把所有时间都花在往返于管理员之间,在每次往返中浪费时间和金金钱。这就是“存储布局”(storage layout)的问题:即数据的物理组织方式,它决定了计算机检索其工作所需信息的快慢与成本高低。

在机器学习的世界里,计算机就像是试图为一场大考而努力学习的饥饿学生。它们需要吞噬数百万张图像来学习什么是猫或汽车。但如果食物(数据)的呈现方式让人难以吞咽,学生就会感到疲惫,考试会变得漫长,而且食堂账单(云端成本)也会飙升。直到现在,专家们必须猜测这些数字书籍的最佳堆叠方式,依赖于为不同类型图书馆制定的规则。这篇名为 LayoutBench 的论文介入并解决了这场争论。它搭建了一个巨大的赛道,来测试在云端组织多媒体数据的三种不同方式,精确测量它们的速度、移动的数据量以及成本。目标很简单:找到一种既能让计算机学习最快,又不会让钱包大出血的存储策略。

三大竞争者:散落者、装箱者与粘合者

为了理解这场比赛,我们首先需要认识一下研究人员测试的三位“选手”,即三种“布局”。他们使用了一个名为 ImageNet 的大规模数据集(包含超过一百万张图像),并要求计算机根据特定规则(如“寻找所有斑马的照片”或“寻找小于 500 KB 的照片”)来查找特定图片。

  1. 布局 1 (L1): “一个接一个”的散落法。
    想象一个图书馆,每一本书都放在自己微小的独立书架上。如果你要找 10 本书,你就得走进图书馆,请求第一本书,等待它递给你,然后走回来,请求第二本,以此类推。在云端,这意味着每张图像都是一个独立的个体文件。计算机必须为每一张图像发送单独的请求。这种方法很简单,但很慢,因为计算机在说“你好,我想要这个文件”以及等待“你好”的回应上花费了大量时间。

  2. 布局 2 (L2): “Tar 归档”的装箱法。
    现在,想象图书管理员把 100 本书装进一个单一的纸板箱里。要拿一本书,你请求整个箱子,管理员把整个箱子递给你,但你只取你需要的特定页面。在云端,这意味着将许多图像打包进一个单一的大文件(称为“tar”归档)。当计算机想要一张图像时,它会请求该文件中的特定切片。由于计算机可以保持与箱子的连接开启,它可以快速抓取多个切片,而不必每次都重复说“你好”。

  3. 布局 3 (L3): “列式”的粘合法。
    这是最复杂的方法。想象所有的书都被熔化并重新塑造成一个巨大的、坚固的塑料块,每一页书都被按特定顺序粘在一起。要找一页,你不是在找书,而是请求一个超级聪明的机器人(数据库引擎)切开这个巨大的塑料块。机器人准确知道信息的位置并切出一块。然而,由于页面是粘在一起的,机器人经常不得不切出一个巨大的块,从而拖带了很多你并不需要的额外重量。

比赛结果:速度、数据与价格标签

研究人员使用不同规模的计算机(有些快,有些内存大)在三种布局上运行了 11 种不同类型的搜索。以下是他们的发现,这有点令人惊讶。

速度对决
对于非常小的请求——比如只找一两张图像——装箱法 (L2) 是最快的。它击败了散落法 (L1),因为它不必在每次获取文件时都浪费时间向云端服务器说“你好”。它复用了同一个连接,就像一位不需要排队等待的常客。

然而,随着请求规模变大,散落法 (L1) 在一段时间内实际上开始反超,因为那些“箱子”变得过于沉重,难以高效管理。但随后,对于大规模请求——寻找数十万张图像时——粘合法 (L3) 夺得了桂冠。这个超级聪明的机器人可以极其快速地切开巨大的数据块,但前提是计算机有足够的内存来容纳这一切片。

数据拖累
这就是粘合法 (L3) 陷入麻烦的地方。因为它切出的数据块非常大,所以经常会拖带过多的不必要信息。论文发现,对于小型搜索,L3 为了获取单张图像传输了约 57 MB 的数据,而其他方法传输的不到 1 MB。即使对于大型搜索,L3 移动的数据也是其他方法的 3 到 4 倍。这就像你只想点一片披萨,结果外卖员却把整个冷冻披萨盒、酱料、奶酪和额外的饼皮全都送来了。

经营成本
最令人震惊的发现是关于金钱的。在云端,你支付两项费用:计算机运行的时间和下载的数据量。研究人员发现,数据传输成本占了总账单的 98% 以上。计算机租赁成本几乎可以忽略不计。

由于粘合法 (L3) 移动了如此多的额外数据,它的成本最终比装箱法 (L2) 高出了 11.5 倍。事实上,对于一组标准查询,L2 的成本约为 0.80 美元,而 L3 的成本超过了 9.20 美元散落法 (L1) 也很便宜,但在处理大型任务时比 L2 稍慢。

最终裁定

论文得出结论,并没有一种适用于所有情况的“完美”布局,但对于大多数基于图像的任务,有一个明显的赢家。

  • 装箱法 (L2) 是最佳平衡点。它提供了速度与成本的最佳平衡。它对于大多数工作来说足够快,并且能保持较低的数据传输量,为你节省一大笔钱。
  • 散落法 (L1) 对于极小型的任务还可以,但随着规模扩大会变得缓慢且低效。
  • 粘合法 (L3) 是一把双刃剑。对于大规模、复杂的搜索,它极其迅速,但它对计算机内存要求很高,并且会因为拖带了额外的多余数据而收取高昂的价格。只有当你进行那种“速度比账单更重要”的大型重型作业时,它才值得。

作者建议,对于大多数在云端处理图像的人来说,坚持使用装箱法 (L2) 是最明智的选择。这就像把午餐装在一个整齐的保鲜盒里:既容易拿取,又不会浪费空间,也不会让你为了吃个三明治而支付整个厨房的费用。研究还指出,这些结果是针对图像的;如果你处理的是巨大的视频文件,规则可能会发生变化,但目前来看,“箱子”赢得了比赛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →