想象一下,你正试图理解一个由三位朋友同时讲述的复杂故事:一位在说话,一位在播放视频,另一位在播放音乐。
旧方式:“一对一”访谈
目前的 AI 模型(比如现在大多数智能手机中的模型)试图通过分别采访每一位朋友来理解这个故事。
- 首先,AI 问说话者:“你觉得音乐怎么样?”
- 然后,AI 问说话者:“你觉得视频怎么样?”
- 最后,AI 问说话者:“你觉得视频和音乐结合在一起怎么样?”
问题在于,AI 把音乐和视频当作互不相干的陌生人。它从未问过:“音乐和视频结合在一起是如何改变说话者所表达的意义的?”它错失了当这三个元素在同一时刻完美契合时所产生的“魔力”。此外,如果你增加第四个朋友(比如一个温度传感器),AI 就必须进行更多的单独采访,变得越来越慢,也更耗费内存,就像一个试图为不断壮大的团队安排一对一会议的经理一样。
新方式:“小组集会”(GRAMformer)
该论文的作者 Giordano Cicchetti 及其团队开发了一个名为 GRAMformer 的新系统。他们没有采用单独采访的方式,而是创建了一种名为**体积多模态交叉注意力(Volumetric Multimodal Cross-Attention, VMA)**的“小组集会”机制。
以下是利用一个简单的类比来解释其工作原理:
1. 对话的“形状”
想象说话者、视频和音频是空间中漂浮的三根木棒。
- 旧 AI: 仅仅测量说话者与视频有多近,以及说话者与音频有多近。它忽略了由这三者构成的形状。
- GRAMformer: 它观察当你把这三根木棒连接在一起时所形成的3D 形状(一个体积)。
- 如果木棒都指向同一个方向(对齐),那么这个形状是扁平的,几乎没有体积。
- 如果木棒指向不同的方向,但仍形成一个连贯的结构,那么这个形状就会具有特定的体积。
- AI 使用这个“体积”作为一个评分标准。它会问:“这三部分信息是否能够组合成一个稳固、有意义的形状?”
这使得 AI 能够瞬间理解这三者(或更多)之间的整体关系,而不是仅仅通过两两组合来进行推测。
2. 为什么它更聪明、更轻量?
- 不再有“二次方”式的混乱: 在旧方式中,如果你增加一个新朋友,AI 就必须做双倍的工作。这就像是在派对上增加一个人,却突然需要为每两个人的组合都安排一次会议。
- GRAMformer 的解决方案: 因为它同时观察“小组体积”,所以增加更多朋友并不会导致数学计算量爆炸。它保持了高效,就像一个大家同时发言的群聊,而不是一个需要逐一打电话的电话树。
3. 他们测试了什么?
团队在计算机需要理解人类情感和动作的任务中测试了这个新的“小组集会”系统。他们使用了涉及以下内容的数据库:
- 情感分析: 通过综合观察文字、声音和面部表情,来判断一段视频片段是快乐、悲伤还是愤怒。
- 幽默与讽刺: 判断一个笑话究竟是真幽默还是在讽器讽刺。
- 机器人技术: 帮助机器人将力觉和触觉传感器数据与视觉数据结合起来理解。
结果:
在这些测试中,GRAMformer 能够比旧系统更好地理解“小组氛围”。它在预测情绪和讽刺方面的得分更高,而且在实现这一目标时,比它所对比的那些沉重、复杂的模型使用了更少的计算机内存和更少的参数(所需的“脑力”更少)。
总结
你可以把旧 AI 想象成一名通过逐一审问嫌疑人来试图推测真相的侦探。而 GRAMformer 则是一位将所有嫌疑人同时关进一个房间,并通过观察他们彼此之间的互动来瞬间洞察全局的侦探。它更快、更轻量,并且更擅长理解不同信息是如何作为一个整体协同工作的。
技术摘要:GRAMformer – 通过体积化多模态交叉注意力实现任意阶模态交互
问题陈述
当前的多模态 Transformer 架构高度依赖注意力机制来整合异构信息。然而,现有方法在建模两个以上模态之间的交互时存在根本性的局限性:
- 成对限制(Pairwise Limitations): 标准的交叉注意力在查询(query)与每个模态特定的键(key)之间独立地计算相关性。这种成对的点积公式无法显式地建模依赖于多个表示之联合配置(例如,一组向量是否位于一个共同的低维子空间内)的交互。
- 可扩展性与效率:
- 拼接策略(Concatenation Strategies): 早期融合方法将所有模态的 Token 拼接成单个序列进行联合自注意力计算。随着模态数量的增加,这会导致内存和计算量呈二次方增长,并且无法计算拼接后的模态之间的交互。
- 成对架构(Pairwise Architectures): 使用针对每个模态对的独立交叉注意力模块的方法,其参数量和内存随模态数量呈二次方增长,同时仍无法捕捉涉及三个或更多模态的同时高阶依赖关系。
- 张量化方法(Tensorized Approaches): 最近通过张量积或分解将注意力扩展到三种模态的尝试,通常需要严苛的近似或秩选择,这可能会抑制细粒度或模态特定的依赖关系。
因此,目前缺乏一种能够定义注意力作为一组模态表示之函数,从而在不产生过高计算成本的情况下,捕获真正高阶多模态对齐的机制。
方法论
体积化多模态交叉注意力 (VMA)
作者提出了体积化多模态交叉注意力 (VMA),这是一种新型机制,它用统一的几何度量取代了成对相似度。VMA 不再逐个 Token 评估相似度,而是基于查询与多个模态特定键的联合几何结构来计算注意力分数。
- 几何公式: 对于一个查询 Token q 和一组来自 M 个模态的对齐键 Token {k1,…,kM},该方法构建一个矩阵 Z=[q,k1,…,kM]。联合多模态相似度由这些向量所张成的平行多面体的体积定义,计算为相关 Gram 矩阵 G=Z⊤Z 的行列式的平方根:
Vol(q,k1,…,kM)=det(G)+ϵ
该体积作为联合线性相关性的标量度量:当向量相互对齐(接近一个低维子空间)时,体积较低;当它们张成更高维度的区域时,体积增加。
- 注意力 Logits: 最终的注意力 Logit 将此高阶几何项与标准的点积正则化相结合,以保留强双模态交互:
s(q,k1,…,kM)=−β⋅Vol(q,k1,…,kM)+m=1∑Md⟨q,km⟩
其中,β 控制高阶信息的注入。该体积项在正交变换和调节模态的排列下具有不变性。
- 值聚合(Value Aggregation): 为了动态控制每个模态的贡献,一个基于查询的门控机制会在平均各模态提取的信息以形成最终输出之前,对每个模态的信息进行调制。
- 多头扩展 (M-VMA): 该机制被扩展到多头公式中,其中体积化注意力在 H 个子空间中独立计算,只要“模态数加一”不超过头维度,其数学有效性便始终成立。
GRAMformer 架构
作者将 VMA 集成到一个名为 GRAMformer 的新型 Transformer 架构中。
- 设计: GRAMformer 遵循标准的 Transformer 编码器结构(残差连接、层归一化、前馈网络),但将传统的交叉注意力层替换为 VMA 或 M-VMA。
- 融合策略: 在多模态分类设置中,一种模态(通常是文本)作为查询流,其余模态作为调节流。VMA 块在每一层都会对所有调节模态进行联合注意力计算,从而显式地建模它们的交互,而不是依赖于成对融合。
- 效率: 该架构设计得非常轻量。与拼接或成对策略不同,VMA 随着模态数量的增加能高效扩展,而不会导致参数或内存的大幅增加。
核心贡献
- 识别局限性: 本文强调了成对注意力机制在建模高阶多模态依赖方面的根本缺陷,以及现有融合策略的低效性。
- 体积化多模态交叉注意力 (VMA): 引入了一种新型注意力机制,将注意力分数定义为查询与多个键的联合几何(体积)之函数,从而实现了对任意阶模态交互的原生建模。
- GRAMformer: 将 VMA 集成到一个轻量级 Transformer 架构中,该架构在多模态任务中展示了卓越的有效性和效率,且无需依赖成对计算或沉重的拼接操作。
实验结果
提出的模型在包括情感分析(MOSI、MOSEI)、幽默/讽刺检测(UR-FUNNY、MUsTARD)以及机器人数据集(MuJoCo Push、视觉与触觉)在内的 MultiBench 套件上进行了评估。
- 性能: GRAMformer 在多个数据集上达到了最先进(SOTA)或极具竞争力的结果。
- 在 MOSI 上,它实现了 87.90% 的 Acc-2(使用预提取特征)和 89.94%(进行 BERT 微调),超越了 MMML、MulT 和 Self-MM 等强基线模型。
- 在 MOSEI 上,它实现了 84.07%(预提取)和 87.39%(微调)的 Acc-2。
- 在 UR-FUNNY 和 MUsTARD 上,它分别实现了 62.46% 和 63.96% 的准确率,超过了 MulT 和 TF 等基线模型。
- 效率:
- 参数量: GRAMformer 显著更轻量。例如,在带有 BERT 微调的 MOSI 数据集上,它使用了 110.1M 参数,而 TeTFN 使用了 110.7M,MMML 使用了 889.6M。在预提取设置下,它仅使用 0.66M 参数。
- 可扩展性: 随着模态数量增加(从 2 到 6),GRAMformer 的参数和内存使用量保持线性或近线性增长,而成对和拼接方法则表现出二次方增长。
重要性与主张
论文声称 GRAMformer 通过提供一种能够显式建模联合多模态对齐而非依赖隐式或成对近似的机制,填补了多模态学习中的关键空白。通过利用表示空间的几何体积,该模型能够捕捉到在标准点积注意力中会丢失的高阶依赖关系。
作者强调,这种方法允许:
- 原生建模任意阶交互: 该机制适用于任何数量的模态,无需受到限制性的低秩假设或张量分解的影响。
- 计算效率: 与现有的高性能多模态 Transformer 相比,它以显著减少的参数量和内存占用实现了更优越的性能。
- 架构兼容性: 其设计保留了标准 Transformer 的归纳偏置和训练程序,可以作为现有系统中交叉注意力层的“即插即用”替代方案。
这项工作表明,从成对相似度转向基于几何体积的注意力,是扩展多模态系统以应对复杂多模态场景的一条可行且有效的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。