Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention
本文提出了一种同步感知加速框架,该框架利用一种受保护的稀疏注意力策略,通过选择性地稀疏化冗余的跨模态交互,同时保留对维持音视频同步至关重要的关键标记,从而降低音视频生成模型的高昂推理成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:计算机不仅能创造动态图像,还能发明属于这些图像的声音,使两者感觉像是一个统一的、有生命的整体。多年来,研究人员一直致力于开发独立的系统:一个用于生成视频,另一个用于生成音频。最近,他们开始构建统一的模型,能够同时生成两者,确保角色的嘴型与声音完美同步,或者鼓点与鼓棒敲击的视觉动作精准匹配。这是向前迈出的重要一步,将同步从后期制作的修复过程转变为创作过程的核心部分。然而,这种统一也带来了沉重的代价。创建这些同步视频需要计算机进行大量的复杂数学运算,反复检查每一帧画面和每一个音符,以保持和谐。这个过程非常耗时,以至于即使生成短短几秒钟的内容也需要很长时间,这使得其使用过程既缓慢又昂ль。
挑战在于这些模型是如何思考的。为了提高速度,工程师们开发了一些技术来跳过不必要的计算,就像读者通过只关注最重要的句子来略读书籍一样。在仅生成视频的情况下,这种方法效果很好,因为场景的大部分是静态或重复的;一片天空或一面墙在每一时刻的变化并不大,因此计算机可以安全地忽略这些细节。但当加入音频时,规则改变了。一片天空在视频本身看来可能并不重要,但如果天空中有一只鸟在鸣叫,那么这个特定的视觉细节对于计算机生成正确的音效就变得至关重要。如果加速技术盲目地跳过这些“不重要”的视觉部分以节省时间,它可能会意外地删除计算机维持声画同步所需的关键证据。其结果就是视频虽然变快了,但感觉不对劲,音频落后于动作,或者声音与屏幕上的事件无法匹配。
上海交通大学和阿里巴巴的研究人员提出了一种处理这一问题的新方法。他们没有将视频分支和音频分支视为可以独立加速的独立实体,而是设计了一个理解两者深层联系的系统。他们的核心洞察在于,计算机自身的内部注意力机制已经知道哪些视频部分对声音很重要,反之亦然。当模型观察一帧视频以决定发出什么声音时,它会自然地将注意力集中在特定区域,例如人的嘴巴或正在被敲击的鼓。同样,当它观察一段声音以决定创造什么样的视觉效果时,它会专注于音频中与视觉事件相对应的特定时刻。研究人员意识到,这种注意力模式并非随机的,它是高度结构化的,并揭示了同步发生的精确位置。
为了在不破坏同步的前提下解决速度问题,团队引入了一种称为“同步感知保护性稀疏注意力”(synchronization-aware protected sparse attention)的方法。简单来说,这意味着计算机被允许跳过绝大部分的视频和音频数据计算,但严禁跳过那些被模型识别为保持声画同步至关重要的特定部分。该系统通过首先绘制出这些关键区域来工作。它观察视频分支和音频分支是如何相互交流的,并创建一个指南,突出显示最重要的“标记”(tokens)或数据点。在生成过程中,计算机仅对这些被强调的区域进行完整的、详细的计算。对于其他部分,它则使用一种更快速、更简化的方法来跳过繁重的计算任务。这种方法确保了同步的“骨架”保持完整,即使在其他计算过程被精简的情况下也是如此。
研究人员还解决了复用旧数据的问题。在视频生成中,如果场景变化不大,通常会保存当前步骤的结果并将其用于接下来的几步。然而,在视听生成中,视频中极其微小的变化(例如手部的轻微移动)都可能需要完全不同的声音。新系统为这种复用过程增加了安全检查。在决定复用保存的结果之前,它不仅检查视频看起来是否相似,还会检查视频与音频之间的关系是否保持不变。如果视觉与听觉交互的关键区域发生了即使是极细微的偏移,系统就会拒绝复用旧数据,并重新进行计算。这防止了模型为了节省时间而意外地锁定声画不匹配的情况。
在对现有开源模型的测试中,该方法证明了其高效性。在一个流行的模型上,研究人员在保持视频质量和同步精度几乎与缓慢的非加速版本完全一致的情况下,实现了近乎两倍的处理速度。在另一个模型上,他们在仅有轻微质量权衡的情况下也看到了类似的提速效果。结果表明,通过保护那些对同步至关重要的计算,系统可以运行得更快,而不会产生通常困扰加速模型的伪影或时序错误。视频质量保持清晰,音频听起来自然,且两者始终步调一致。
这项工作表明,高效媒体生成的未来不仅在于让计算变得更快,还在于让计算变得更聪明——即明确哪些内容需要保留,哪些需要舍弃。通过聆听模型自身关于“什么重要”的内部信号,研究人员找到了保持视听平衡的方法。其结果是,该系统可以更快地生成同步的视听内容,为这些强大工具走向更实际、更广泛的应用打开了大门。研究结果表明,我们不必在速度和质量之间做选择;只要有正确的引导,我们可以兼得两者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。