← 最新论文
🤖 machine learning

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

该论文介绍了 LAION-BVD,这是一个包含 8000 万个视频(1000 万小时)且具有合成生成标题的海量开放数据集,它实现了跨视频、音频和图像-文本任务的最先进多模态预训练。

原作者: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Ma
发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的现代时代,计算机不再是通过学习规则,而是通过吸收大量的示例来学习如何观察和聆听世界。多年来,研究人员构建了庞大的图片与文本描述配对的库,教会机器理解一张狗的照片通常会伴随着“狗”这个词。这一过程被称为多模态学习(multimodal learning),它使计算机能够将所见与所读联系起来,为能够描述图像、回答相关问题甚至根据文本生成新图片的系统奠定了基础。然而,尽管这些静态图像库已增长到包含数十亿条条目,但与之相对应的动态影像和声音集合规模却一直保持在令人惊讶的微小水平。视频比静态照片复杂得多;它们包含运动、变化的场景,以及通常与视觉效果同步讲述故事的音轨。挑战在于,收集足够的视频数据来训练这些强大的系统极其困难,因为视频通常被锁在商业平台的围墙之后,并且需要巨大的计算能力来进行处理。

一支研究团队现在通过发布一个名为 LAION-BVD 的规模空前的数据集,打破了这一障碍。这个集合代表了开放科学的一次巨大飞跃,提供了一个长达 1000 万小时视频的库。为了直观理解,如果一个人不间断地观看这段素材中的每一小时,将需要超过一千年的时间才能看完。该数据集的构建首先是从公共网络(特别是来自 YouTube、Vimeo 和 Dailymotion 等主要平台)中收集了 13 亿个视频链接。从这个庞大的列表中,研究人员成功下载了 8000 万个独特的视频。随后,他们使用自动化工具根据场景变化将这些长视频切割成较短且具有意义的片段,以确保每个片段捕捉的是连贯的瞬间,而非杂乱无章且互不相关的镜头。

这项工作的真正创新之处在于研究人员如何教会计算机理解这些片段。由于没有任何人类能够可能观看 1000 万小时的视频并为每一秒钟编写描述,该团队使用人工智能来自动生成文本标签。他们训练了专门的模型来观看视频片段并编写描述动作的简短合成说明,同时使用独立的模型倾听音频轨道,以描述声音——从音乐到语音再到环境噪音。他们还从视频中提取了单帧图像,从而创建了一个包含 3 亿张图像的庞大集合,每张图像都有自己的描述。这一过程创造了一个丰富且多层级的数据集,使计算机可以学习将视频与文本、音频与文本,甚至将单张图像与文本联系起来,而这一切都源自同一份素材。

当研究人员通过在这些新数据上训练计算机模型来测试这项成果时,结果令人瞩目。这些模型理解视频和音频的能力,达到了与使用现有较小数据集训练的模型相当、甚至在某些情况下更优的水平。随着研究人员向模型输入更多数据并使用更大的计算架构,性能持续提升,这表明这个庞大的库是一个用于教导机器的高质量资源。经过视频训练的模型在识别人类动作方面变得更加出色,例如识别某人正在打篮球或进行特定的舞蹈,并且在根据文本描述寻找正确视频的任务上变得更加熟练。同样,经过音频训练的模型在将口语或书面描述与正确的声音(无论是鸟鸣还是汽车引擎启动声)进行匹配方面也表现出了强大的能力。

或许令人惊讶的是,从这些视频中提取的图像也被证明是强大的新学习来源。虽然在基于这些视频衍生的图像进行训练时,模型在以一种僵化、教科书式的方法识别特定物体方面并非最顶尖,但它们在另一项任务中表现卓越:即为给定的描述找到正确的图像。这表明,视频中所捕捉到的视觉世界提供了与标准网络图像不同种类的多样性,提供了一种独特的视角,有助于计算机更广泛地理解世界。研究人员发现,他们自动化系统生成的标题足够准确且有用,绝大多数标题都能正确描述片段的内容。

这项工作不仅仅是提供了一个新的数据集;它证明了训练先进视频和音频 AI 的瓶颈不再是缺乏可用数据,而是处理数据所需的工程投入。通过展示一个庞大的、公开可用的网络视频集合可以被成功策划并用于训练最先进的模型,研究人员为新一代人工智能开启了大门。他们证明了,只要拥有正确的工具,那片广阔、混乱的网络视频海洋就可以被转化为结构化的、具有教育意义的资源,让机器能够从人类经验的全谱系中学习——不仅是静止的画面,还有流动的影像与律动的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →