← 最新论文
💻 computer science

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3 是一个轨迹引导的音视频生成框架,它通过使用物体轨迹作为共同控制视觉运动和声学事件的共享运动学先验,增强了物理连贯性与运动-声音的同步性,并得到了一个名为 PAV 的新策划的大规模数据集的支持。

原作者: Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下正在观看一段锤子敲击钉子的视频。在一个完美的世界里,撞击声发生的时间点应该与金属接触木头的瞬间完全一致,且声音的锐度应与撞击的力量相匹配。多年来,计算机一直难以创造出让动作与声音感觉属于同一个物理现实的视频。虽然人工智能在生成精美的动态图像或根据文本创建逼真的声景方面已经变得非常出色,但将两者结合起来往往会导致脱节。物体可能会以违背重力的方式运动,或者声音可能会晚出现零点几秒,或者对于剧烈的撞击来说声音可能太小了。核心问题在于,生成视频的计算机和生成音频的计算机一直在孤立地工作,它们各自在猜测对方应该做什么,而没有对物体如何在空间中实际移动建立共同的理解。

阿里巴巴集团和复旦大学的研究人员通过一个名为 Tora3 的新系统解决了这一差距。他们的这种方法建立在一个简单而强大的理念之上:将物体所经过的路径作为视频和音频的共享蓝图。与其让计算机去猜测一辆车应该如何行驶或一个球应该如何弹跳,该系统首先定义精确的轨迹(即物体遵循的线条),然后利用这条线来规定视觉运动及其伴随的声音。这种方法不仅将路径视为物体移动的引导,更将其视为一种物理信息源,告诉系统何时发出声音以及声音应该有多大。通过将视觉和听觉都锚定在相同的运动数学描述上,研究人员创造出的视频让物理感显得真实,且音频与动作实现了完美的同步。

研究人员发现,以往的方法之所以失败,是因为它们试图分别生成视频和音频,然后寄希望于它们能匹配起来,或者仅将运动路径作为视频的视觉引导,而忽略了其引导声音的潜力。Tora3 通过将轨迹作为“运动学先验”(kinematic prior)改变了这一点——这是一个技术术语,意指它将路径作为视频和音频生成器都必须遵循的基本规则。当系统看到一个物体沿着特定线条运动时,它会计算每一点的速度和加速度。如果一个物体正在加速,系统就会知道声音应该变大或改变音调。如果一个物体撞击表面,系统就能准确知道何时触发尖锐的撞击声。这种对路径的共同依赖确保了视觉和听觉元素不仅在同一时间发生,而且是在对相同的物理力量做出反应。

为了实现这一点,团队开发了一种将路径信息输入计算机大脑的具体方式。对于视频部分,他们并没有构建一个复杂的新机器来理解运动,而是简单地将视频第一帧的视觉信息沿着物体的路径进行移动。这是一种直接且高效的方式,用来告诉计算机:“这个物体在这里,它正向那里移动”,而无需额外的处理层来干扰系统。对于音频,系统会观察路径并计算物体的速度以及它加速或减速的快慢。这些计算随后被用于塑造声音,确保快速移动的物体产生与慢速移动不同的声音,并且突然停止会产生截然不同的噪音。

团队还开发了一种将这些指令融入最终视频的新方法。他们意识到,视频中的某些部分需要严格遵循路径以确保物体运动正确,而其他部分(如背景)则应该保持灵活性。他们的解决方案是在视频生成过程中使用两条不同的规则:一条规则将物体紧紧绑定在其路径上,另一条规则则允许场景的其他部分自然流动。这种混合方法既能防止视频看起来僵硬或不自然,又能确保主要动作遵循预定的轨迹。

为了训练这个系统,研究人员收集了 46 万个专注于运动的视频片段。他们使用先进工具自动识别这些视频中的物体并绘制出它们的路径,从而创建一个富含运动模式的数据集。这使得系统能够从各种现实世界的运动中学习,从行驶在公路上的汽车到拍打水面的海豹。在与其它领先系统的对比测试中,Tora3 生成的视频不仅视觉上更清晰,而且运动与声音之间的联系也更加紧密。该系统在匹配声音与接触时刻的同步性,以及根据运动强度调整声音音量方面表现得更为出色。

结果表明,赋予人工智能一个共享的物理规则手册(在这种情况下是物体的路径)是提高生成内容真实感的有力手段。该系统不仅让事物看起来很美观,更让它们感觉像是存在于一个受一致物理定律支配的世界中。虽然这项技术仍在不断完善,但这种方法的成功凸显了数字媒体未来一个极具前景的方向,即视觉与听觉之间的界限将变得与现实无法区分。研究人员计划通过探索如何将其他物理因素(例如物体的材质或声音在房间中的传播方式)加入到这个共享框架中,以创造出更加令人信服的体验,从而继续开展这项工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →