← 最新论文
🤖 machine learning

BRIDLE: Generalized Self-supervised Learning with Quantization

BRIDLE 是一个广义的自监督学习框架,它通过将层次化残差量化集成到双向训练过程中,增强了音频、图像和视频模态的表示质量,从而克服了单码本向量量化的局限性,并在各种下游任务上实现了最先进的性能。

原作者: Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hoang M. Nguyen, Satya N. Shukla, Qiang Zhang, Hanchao Yu, Sreya D. Roy, Dipesh Tamboli, Taipeng Tian, Lingjiong Zhu, Yuchen Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界里,机器正变得极其擅长识别模式,但它们通常需要大量的、由人类标注的样本来进行学习。想象一下,试图教一个孩子识别动物,需要向他展示成千上万张图片,并且每一张都要由一位耐心的老师仔细地贴上动物名称的标签。虽然这种方法有效,但它既缓慢又昂贵,并且限制了机器能学习的内容,因为它被困在等待人类帮助的过程中。一种更强大的方法被称为自监督学习(self-supervised learning),它允许机器通过研究给定的原始数据进行自我教学,在不需要任何人写下答案的情况下,寻找隐藏的结构和联系。这种方法已经彻底改变了计算机理解语言的方式,使其能够通过阅读数十亿本书籍并猜测缺失的词汇,来掌握句子的深层含义。现在,研究人员正试图将这种同类的自我教学能力引入声音、图像和视频领域,希望创造出能够像理解文字一样自然地理解视觉和听觉世界的系统。

将这些自教方法应用于声音和视频所面临的挑战在于,这些信号是连续且复杂的,不像句子中的离散词汇那样。为了让计算机更容易处理这些信号,研究人员通常将其分解成细小的、截然不同的块,就像将一股平滑的水流变成一系列独立的液滴一样。一种流行的做法涉及到一个“分词器”(tokenizer),这个组件充当着翻译官的角色,将原始信号转换为一系列离散的标记(tokens)。在一段时间内,最成功的系统使用一种简单的翻译器,它从一个固定的选项列表中挑选单个标记来代表一段信号。然而,这种方法存在局限性:它迫使计算机只能从一个扁平的列表中选择一个选项,这可能会遗失构成复杂声音或运动图像的微妙且具有层次感的细节。这就像试图通过从调色板中只选一种颜色来描述一幅复杂的画作,而不是通过混合多种色调来捕捉其深度与纹理。

来自佛罗里达州立大学和 Meta Platforms Inc. 的一个研究小组开发了一个名为 BRIDLE 的新系统来解决这个问题。他们的工作重点在于改进用于这些自教系统的翻译器,即分词器。他们没有依赖于单一的、扁平的标记列表,而是引入了一个分阶段工作的层级系统。想象一下,尝试描述一个位置时,不是通过从电话簿中挑选一个单一的地址,而是先确定国家,然后是省份,接着是城市,最后是街道。每一步都为描述增加了细节层。在 BRIDLE 系统中,计算机将声音或图像分解为一系列残差(residuals)或剩余细节,并使用一系列代码簿(codebooks)来描述每一层。第一阶段捕捉宽泛、通用的特征,而随后的阶段则填充更精细、更具体的细节。通过将这些层叠加在一起,该系统可以比单步法创造出远为丰富且精确的数据表示。

研究人员在三种不同类型的数据上测试了这种新方法:音频、图像和视频。他们在海量数据集上训练了模型,包括来自 YouTube 的数百万个声音片段、来自标准 ImageNet 集合的一百多万张图像,以及显示人类动作的数十万个视频片段。在每种情况下,他们都将这种新的层级方法与旧的单列表方法进行了对比,确保总的可选标记数量保持不变,因此唯一的区别在于这些标记是如何组织的。结果是清晰且一致的。这个使用多阶段、分层方法的新系统,始终优于旧的方法。这种进步在研究人员测试计算机识别从未见过的新事物的能力(即线性探测,linear probing)时尤为明显。这表明新系统学习到了一种更灵活、更稳健的世界理解能力,创造了更易于用于其他任务的表示形式。

除了性能数据之外,研究人员还调查了如何让系统学习得更有效。他们发现,系统开始学习过程的方式至关重要。通过使用一种特定的数学技术来初始化系统,使起始点均匀分布,而不是让它们随机分布,系统学习得更快、更可靠。他们还开发了一种方法来确保系统的每个部分都被使用,从而防止计算机忽略其自身词汇表中的大部分内容。这些技术性的改进,结合新的层级结构,使得该系统在音频分类方面达到了最先进的水平,匹配或超越了现有的最佳模型。这项工作证明了机器分解和表示信息的方式与学习算法本身同样重要。通过从扁平的、单选系统转向深层的、分层的系统,研究人员展示了机器可以如何以更细腻、更清晰的方式感知和聆听世界,为开发更强大、更多功能的通用人工智能铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →