✨ 要点🔬 技术摘要
在现代人工智能的世界里,机器正变得极其擅长识别模式,但它们通常需要大量的、由人类标注的样本来进行学习。想象一下,试图教一个孩子识别动物,需要向他展示成千上万张图片,并且每一张都要由一位耐心的老师仔细地贴上动物名称的标签。虽然这种方法有效,但它既缓慢又昂贵,并且限制了机器能学习的内容,因为它被困在等待人类帮助的过程中。一种更强大的方法被称为自监督学习(self-supervised learning),它允许机器通过研究给定的原始数据进行自我教学,在不需要任何人写下答案的情况下,寻找隐藏的结构和联系。这种方法已经彻底改变了计算机理解语言的方式,使其能够通过阅读数十亿本书籍并猜测缺失的词汇,来掌握句子的深层含义。现在,研究人员正试图将这种同类的自我教学能力引入声音、图像和视频领域,希望创造出能够像理解文字一样自然地理解视觉和听觉世界的系统。
将这些自教方法应用于声音和视频所面临的挑战在于,这些信号是连续且复杂的,不像句子中的离散词汇那样。为了让计算机更容易处理这些信号,研究人员通常将其分解成细小的、截然不同的块,就像将一股平滑的水流变成一系列独立的液滴一样。一种流行的做法涉及到一个“分词器”(tokenizer),这个组件充当着翻译官的角色,将原始信号转换为一系列离散的标记(tokens)。在一段时间内,最成功的系统使用一种简单的翻译器,它从一个固定的选项列表中挑选单个标记来代表一段信号。然而,这种方法存在局限性:它迫使计算机只能从一个扁平的列表中选择一个选项,这可能会遗失构成复杂声音或运动图像的微妙且具有层次感的细节。这就像试图通过从调色板中只选一种颜色来描述一幅复杂的画作,而不是通过混合多种色调来捕捉其深度与纹理。
来自佛罗里达州立大学和 Meta Platforms Inc. 的一个研究小组开发了一个名为 BRIDLE 的新系统来解决这个问题。他们的工作重点在于改进用于这些自教系统的翻译器,即分词器。他们没有依赖于单一的、扁平的标记列表,而是引入了一个分阶段工作的层级系统。想象一下,尝试描述一个位置时,不是通过从电话簿中挑选一个单一的地址,而是先确定国家,然后是省份,接着是城市,最后是街道。每一步都为描述增加了细节层。在 BRIDLE 系统中,计算机将声音或图像分解为一系列残差(residuals)或剩余细节,并使用一系列代码簿(codebooks)来描述每一层。第一阶段捕捉宽泛、通用的特征,而随后的阶段则填充更精细、更具体的细节。通过将这些层叠加在一起,该系统可以比单步法创造出远为丰富且精确的数据表示。
研究人员在三种不同类型的数据上测试了这种新方法:音频、图像和视频。他们在海量数据集上训练了模型,包括来自 YouTube 的数百万个声音片段、来自标准 ImageNet 集合的一百多万张图像,以及显示人类动作的数十万个视频片段。在每种情况下,他们都将这种新的层级方法与旧的单列表方法进行了对比,确保总的可选标记数量保持不变,因此唯一的区别在于这些标记是如何组织的。结果是清晰且一致的。这个使用多阶段、分层方法的新系统,始终优于旧的方法。这种进步在研究人员测试计算机识别从未见过的新事物的能力(即线性探测,linear probing)时尤为明显。这表明新系统学习到了一种更灵活、更稳健的世界理解能力,创造了更易于用于其他任务的表示形式。
除了性能数据之外,研究人员还调查了如何让系统学习得更有效。他们发现,系统开始学习过程的方式至关重要。通过使用一种特定的数学技术来初始化系统,使起始点均匀分布,而不是让它们随机分布,系统学习得更快、更可靠。他们还开发了一种方法来确保系统的每个部分都被使用,从而防止计算机忽略其自身词汇表中的大部分内容。这些技术性的改进,结合新的层级结构,使得该系统在音频分类方面达到了最先进的水平,匹配或超越了现有的最佳模型。这项工作证明了机器分解和表示信息的方式与学习算法本身同样重要。通过从扁平的、单选系统转向深层的、分层的系统,研究人员展示了机器可以如何以更细腻、更清晰的方式感知和聆听世界,为开发更强大、更多功能的通用人工智能铺平了道路。
技术摘要:BRIDLE
问题陈述 自监督学习(SSL)已成为从音频、图像和视频等多种模态的无标签数据中学习有意义表示的主导范式。虽然受 BERT 启发(如用于音频的 BEATs)的框架通过向量量化(VQ)成功地将双向掩码预测应用于非文本模态,但它们面临着固有的局限性。具体而言,依赖单一、扁平的代码本(codebook)进行标记化(tokenization)构成了一个绑定约束。这种方法往往无法捕捉信号的复杂、多维特性(特别是在多样化的音频环境中),并且存在代码本利用效率低下的问题,即许多代码向量未被使用或利用不足,从而导致表示学习不够理想。
方法论 本文介绍了 BRIDLE (双向残差量化交错离散学习编码器),这是对 BEATs 谱系中目标标记器的一个针对性改进。BRIDLE 并非提出一种全新的训练框架,而是保留了 BEATs 的核心交错编码器-标记器训练循环、掩码预测损失以及 EMA 式的代码本更新方式。其主要创新在于使用**分层残差量化(RQ)**标记器取代了单代码本 VQ 标记器。
关键技术组件包括:
分层残差量化: 不同于从大小为 K K K 的扁平集合中选择单个代码,RQ 标记器利用了 M M M 个大小为 K m K_m K m (例如 M = 4 , K m = 256 M=4, K_m=256 M = 4 , K m = 256 )的代码本。量化过程是加法式且多阶段的:每一阶段量化前一阶段的残差误差。这创造了一种几何结构,其有效组合高达 K m M K_m^M K m M (例如 256 4 ≈ 4 × 10 9 256^4 \approx 4 \times 10^9 25 6 4 ≈ 4 × 1 0 9 ),相比之下,传统的 VQ 仅有 K K K 种组合,从而为编码器提供了更丰富的探索空间。
交错训练: 该框架在编码器训练阶段(此时标记器被冻结并提供目标标记)和标记器训练阶段(此时主编码器作为教师来训练标记器编码器、代码本和标记器估计器)之间交替进行。
代码本优化技术:
初始化: 作者对比了随机初始化与基于首批次潜在向量的 k-means 初始化 ,发现 k-means 更具稳定性和性能优势。
未使用代码重置: 为了防止停滞,如果某个代码的使用计数在第一批次标记器训练期间低于阈值 T u T_u T u ,则会对代码本进行重置。
EMA 更新: 框架采用带有 ϵ \epsilon ϵ -正则化归一化的指数移动平均(EMA)更新方式来更新代码本。
损失函数: 训练涉及用于编码器的掩码交叉熵损失,以及一个复合标记器损失,该损失包含代码本损失(确保潜在向量与量化代码之间的一致性)和余弦相似度损失(使标记器的离散输出与主编码器的嵌入对齐)。
核心贡献
标记器机制改进: 提出了 BRIDLE,它在现有的 BEATs 训练循环内,将单代码本 VQ 替换为分层 RQ 标记器。这一改变在不改变基本训练调度的情况下,提供了实质上更丰富的标记几何结构。
全面评估: 在三种模态上进行了广泛评估:
音频: 在作者的复现设置下,在 AudioSet 和 ESC-50 基准测试中达到了最先进(SOTA)水平。
图像: 在 ImageNet-1K 上表现出竞争力,显示出相对于等效总代码数 VQ 基线的持续改进。
视频: 在 Kinetics-400 动作识别任务上表现提升。
一个显著的发现是,最大的增益出现在**线性探测(linear probing)**阶段,这表明学习到的表示具有更好的线性可分性。
代码本训练分析: 对初始化策略(均匀分布 vs. k-means)和代码重置机制进行了详细分析,证明了这些技术对于优化基于量化的模型的重要性。
理论收敛性: 对带有 ϵ \epsilon ϵ -正则化归一化的 EMA 代码本更新进行了严谨的收敛性分析,证明在温和的假设下,聚类大小、运行嵌入累加器和代码本向量几乎处处收敛。
结果 作者报告称,BRIDLE 在所有模态上均一致优于等效总代码数的 VQ 基线:
音频: 在 AudioSet-2M 上,经过 k-means 初始化的 BRIDLE(iter2)实现了 47.99 的微调 mAP,超过了 VQ BEATs 基线(47.64)。在 ESC-50 和 AudioSet-20K 上也观察到了类似的改进。
图像: 在 ImageNet-1K 上,经过 k-means 初始化的 BRIDLE(iter2)在微调中实现了 81.10% 的 Top-1 准确率,在线性探测中实现了 56.30% ,优于 VQ 变体(FT 为 80.26%,LP 为 53.21%)。
视频: 在 Kinetics-400 上,经过 k-means 初始化的 BRIDLE(iter2)达到了 72.90% 的 Top-1 准确率,而 VQ 变体为 71.32%。 结果表明,RQ 的分层结构使编码器能够学习到更具泛化性和鲁棒性的表示,这在线性探测指标中尤为明显。
意义与主张 本文将 BRIDLE 定位为而非一种全新的框架,而是现有双向 SSL 范式内的一个“针对性标记器机制改进”。作者声称,性能的提升主要源于分层残差结构 提供的更具表达力的标记空间,而非仅仅依靠增加代码利用率。该工作证明了这种架构变化是模态无关的,有效地提升了音频、图像和视频的表示学习。理论贡献包括对该语境下使用的特定 EMA 更新机制进行的首次严谨收敛性分析。作者保持了谦逊的态度,指出虽然 BRIDLE 在 ImageNet 上与其它掩码建模方法(如 MAE 和 BEiT)具有竞争力,但它能以更少的训练迭代次数实现这些结果,并能原生产生适用于生成或检索任务的离散标记输出。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。