← 最新论文
💻 computer science

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

本文介绍了 GRAMformer,一种新型的多模态 Transformer 架构,它采用体积多模态交叉注意力(Volumetric Multimodal cross-Attention, VMA)来高效地建模任意顺序的模态交互,通过基于查询向量与键向量的联合几何体积来计算注意力分数,从而克服了现有成对或拼接方法的局限性。

原作者: Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一个由三位朋友同时讲述的复杂故事:一位在说话,一位在播放视频,另一位在播放音乐。

旧方式:“一对一”访谈
目前的 AI 模型(比如现在大多数智能手机中的模型)试图通过分别采访每一位朋友来理解这个故事。

  • 首先,AI 问说话者:“你觉得音乐怎么样?”
  • 然后,AI 问说话者:“你觉得视频怎么样?”
  • 最后,AI 问说话者:“你觉得视频和音乐结合在一起怎么样?”

问题在于,AI 把音乐和视频当作互不相干的陌生人。它从未问过:“音乐和视频结合在一起是如何改变说话者所表达的意义的?”它错失了当这三个元素在同一时刻完美契合时所产生的“魔力”。此外,如果你增加第四个朋友(比如一个温度传感器),AI 就必须进行更多的单独采访,变得越来越慢,也更耗费内存,就像一个试图为不断壮大的团队安排一对一会议的经理一样。

新方式:“小组集会”(GRAMformer)
该论文的作者 Giordano Cicchetti 及其团队开发了一个名为 GRAMformer 的新系统。他们没有采用单独采访的方式,而是创建了一种名为**体积多模态交叉注意力(Volumetric Multimodal Cross-Attention, VMA)**的“小组集会”机制。

以下是利用一个简单的类比来解释其工作原理:

1. 对话的“形状”

想象说话者、视频和音频是空间中漂浮的三根木棒。

  • 旧 AI: 仅仅测量说话者与视频有多近,以及说话者与音频有多近。它忽略了由这三者构成的形状。
  • GRAMformer: 它观察当你把这三根木棒连接在一起时所形成的3D 形状(一个体积)。
    • 如果木棒都指向同一个方向(对齐),那么这个形状是扁平的,几乎没有体积。
    • 如果木棒指向不同的方向,但仍形成一个连贯的结构,那么这个形状就会具有特定的体积。
    • AI 使用这个“体积”作为一个评分标准。它会问:“这三部分信息是否能够组合成一个稳固、有意义的形状?”

这使得 AI 能够瞬间理解这三者(或更多)之间的整体关系,而不是仅仅通过两两组合来进行推测。

2. 为什么它更聪明、更轻量?

  • 不再有“二次方”式的混乱: 在旧方式中,如果你增加一个新朋友,AI 就必须做双倍的工作。这就像是在派对上增加一个人,却突然需要为每两个人的组合都安排一次会议。
  • GRAMformer 的解决方案: 因为它同时观察“小组体积”,所以增加更多朋友并不会导致数学计算量爆炸。它保持了高效,就像一个大家同时发言的群聊,而不是一个需要逐一打电话的电话树。

3. 他们测试了什么?

团队在计算机需要理解人类情感和动作的任务中测试了这个新的“小组集会”系统。他们使用了涉及以下内容的数据库:

  • 情感分析: 通过综合观察文字、声音和面部表情,来判断一段视频片段是快乐、悲伤还是愤怒。
  • 幽默与讽刺: 判断一个笑话究竟是真幽默还是在讽器讽刺。
  • 机器人技术: 帮助机器人将力觉和触觉传感器数据与视觉数据结合起来理解。

结果:
在这些测试中,GRAMformer 能够比旧系统更好地理解“小组氛围”。它在预测情绪和讽刺方面的得分更高,而且在实现这一目标时,比它所对比的那些沉重、复杂的模型使用了更少的计算机内存更少的参数(所需的“脑力”更少)。

总结

你可以把旧 AI 想象成一名通过逐一审问嫌疑人来试图推测真相的侦探。而 GRAMformer 则是一位将所有嫌疑人同时关进一个房间,并通过观察他们彼此之间的互动来瞬间洞察全局的侦探。它更快、更轻量,并且更擅长理解不同信息是如何作为一个整体协同工作的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →