OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
本文介绍了 Omni-Encoder,这是一种统一的 Transformer 骨干网络,能够以对称的 25 帧/秒速率协同嵌入视觉与音频信号,从而克服特定模态编码器的局限性,进而实现对连续运动的整体性、类人感知,在显著提升细粒度视觉任务性能的同时,保持具有竞争力的视听基准表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图通过每秒只看一张静止照片、同时以全速聆听原声带的方式来理解一部电影。这基本上就是当今大多数“全模态”AI 模型(即能看也能听的系统)的工作方式。它们缓慢地查看视频帧(每秒 1 到 2 帧),却以极快的速度处理音频(每秒 25 次)。这造成了不匹配:AI 以慢动作观察世界,却以实时速度聆听声音,导致它难以将特定的手势与其发出的确切声音联系起来。
本文介绍了一种名为Omni-Encoder的新型 AI 大脑,旨在通过像人类一样同时“看”、“听”并“感受”运动来解决这一问题。
以下是其工作原理,使用简单的类比说明:
1. 问题所在:“慢动作摄像机”与“快耳”
当前的 AI 模型就像一名保安,每 10 秒检查一次走廊,却能瞬间听到每一个脚步声。如果有人在两次检查之间快速挥手,保安就会错过这一动作。
- 问题所在: 现有模型采样视频的速度太慢,无法捕捉快速运动(如手语或体操),却以全速处理音频。这导致它们错过了视觉与听觉之间那种“共舞”般的关联。
2. 解决方案:"25 帧/秒超级大脑”
Omni-Encoder 被设计为以同样的高速度处理视频和音频:每秒 25 帧。它不仅仅是在看图片,而是理解图片之间的运动。
为了在不让计算机因数据过载而崩溃的情况下实现这一点,作者发明了三个巧妙的技巧:
A. “三车道高速公路”(Omni-Encoder 令牌模板)
该系统不再将视频和音频视为一团混乱的数据堆,而是将每一时刻的信息组织成三条 distinct 的“车道”:
- 音频车道: 承载声音。
- “运动”车道(视觉连续): 这是关键要素。这些是特殊的数据点,充当“运动传感器”。它们不关心物体看起来是什么(颜色或形状),只关心它如何从一帧移动到下一帧。可以将它们想象为追踪舞者手部的路径,而非舞者的面部。
- “静态”车道(视觉基础): 承载物体外观的细节(纹理、形状、背景)。
效率技巧: 系统保持“运动”和“音频”车道以全速(25 帧/秒)运行,以确保不遗漏任何运动。然而,它将“静态”车道减速至每秒仅 2 帧。为什么?因为背景不会变化得那么快。这节省了巨大的计算资源,同时保留了快速运动数据。
B. "3D GPS"(Omni-RoPE)
在普通 AI 中,很难区分一段数据是声音、移动的手还是静止的墙壁,因为它们看起来都是相同的数字。
Omni-Encoder 为每一个数据点赋予一个独特的3D GPS 坐标(时间、高度、宽度)。
- 声音获得位于“原点”的坐标 (0,0)。
- 移动的手获得紧邻其旁的坐标 (0,1)。
- 静止的墙壁获得更靠外的坐标 (1,1)。
这使得 AI 能够瞬间明白:“哦,这个数据点是声音,而那个是移动物体”,从而在不混淆的情况下理解它们之间的关系。
C. “滑动窗口”(时间窗口移位)
一次性处理 25 帧视频和音频,就像试图同时阅读图书馆里的每一本书——负担太重。
作者使用了一种称为时间窗口移位的技术。想象一下通过一个每次覆盖 16 页的小窗口来读书。
- 首先,你阅读第 1 到 16 页。
- 然后,你将窗口移动一半,阅读第 9 到 24 页。
- 接着,再次移动。
这使 AI 能够看到故事如何从一个时刻流向下一个时刻,而无需一次性记住整部电影。它保持了思维过程的快速与高效。
3. 结果:他们证明了什么?
团队在需要捕捉快速、细致动作的任务上测试了这一新系统:
- 手语: 识别手语就像阅读一本用快速手部动作写成的书。旧模型的正确率约为 1% 到 37%。Omni-Encoder 达到了90% 到 97% 的正确率,甚至击败了专为手语构建的专用系统。
- 体育与动作: 在识别跳水动作或体操等任务中,它匹配或超越了现有最佳模型。
- 视听推理: 当被问及需要同时听和看的问题时(例如“谁在说话?”),其表现与使用独立“耳朵”和“眼睛”的复杂系统一样出色。
核心结论
该论文声称,通过统一 AI 的“看”与“听”——将它们视为单一、同步的数据流,而非两个分离且不匹配的流——我们可以构建出更像人类那样理解世界的模型。它们能够捕捉连续运动的“感觉”,从而在理解快速动作、手势以及声音与视觉之间的关系方面表现得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。