← 最新论文
🤖 machine learning

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

本文提出了一种轨迹引导的图像到视频扩散流程,通过利用投影的 GPS 遥测数据对预训练模型进行条件控制,以重建海事无人机视频中的缺失帧,在无需特定领域微调的情况下,相较于传统插值基线实现了更优越的视觉质量和运动真实感。

原作者: Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段两艘小船在海上航行的无人机实时视频。突然,网络连接出现故障,视频的一段内容消失了。你面对的是一个空白:你看到了船只的起始画面,也看到了结束画面,但中间部分却缺失了。

通常,计算机会尝试通过猜测中间发生了什么来填补这个空白,这有点像孩子试图用一条直线连接两个点。但如果船只移动迅速或正在转向,这条直线看起来就会显得虚假且模糊。

本文提出了一种更智能的视频修复方法。计算机不再仅仅依据画面进行猜测,而是利用船只本身携带的“秘密地图”:它们的 GPS 数据。

问题:模糊的猜测

可以将传统的视频修复方法(如老电影或标准软件中使用的那些)想象成一位画家,试图仅通过观察画布上的颜色来重现场景。如果船只移动很快,画家就会把颜料涂抹开来,造成一团模糊的混乱。他们不知道船只实际上去了哪里,只知道它们“去了某个地方”。

解决方案:GPS“幽灵向导”

作者构建了一个流程,其作用如同一个由 GPS 引导的木偶师。以下是其逐步工作原理:

  1. 参考帧:计算机从视频中断前船只最后一张清晰的画面开始。
  2. GPS 线索:即使视频中断期间,船只一直在向日志文件发送其精确的位置坐标(纬度和经度)。
  3. 转换:计算机将这些 GPS 数值转换为屏幕上的“像素箭头”。这就像在照片上画一个小箭头,根据船只的真实世界运动,精确指示出下一秒钟船只应该出现的位置。
  4. 魔法艺术家(扩散模型):计算机将这张标注好的照片输入到一个强大的 AI 艺术家(称为“扩散模型”)中。该 AI 经过数百万视频的训练,能够理解水、光和运动的外观。
    • 通常情况下,这个 AI 可能会随机猜测船只的路径。
    • 但由于作者提供了 GPS 箭头,AI 被迫按照 GPS 指示的确切位置绘制船只的移动轨迹。

结果:逼真的重建

本文将该方法与“老派”的猜测技术进行了对比测试。以下是他们的发现:

  • “模糊”的竞争者:传统方法(如光流法和 RIFE)生成的视频要么过于平滑(看起来像卡通),要么运动量不正确。它们看起来像是被“平均化”了,而非真实。
  • GPS 引导的胜者:使用 GPS 数据的方法生成的帧看起来最自然。
    • 运动:船只以真实的移动速度和方向行进,而不仅仅是滑过屏幕。
    • 纹理:水面和船只的细节看起来清晰自然,而非模糊。
    • 准确性:船只最终出现在 GPS 指示的确切位置。

局限性

作者承认,这只是在非常短的片段(仅两秒)上、且仅有两艘船只的情况下进行的测试。这就像在跨州驾驶之前,先在新引擎的短跑道上进行测试。此外,计算机仍然需要人工点击船只一次,以说明“那是绿色的船,那是黄色的船”,以便将 GPS 数据与正确的船只匹配。

核心结论

本文表明,如果你有一段缺失部分的视频,但同时拥有视频中物体的 GPS 日志,你就可以利用这些 GPS 数据来“引导”AI 重建缺失的视频。这就像给 AI 配备了一套 GPS 导航系统,使其无需猜测物体的去向;它只需跟随地图,从而生成比完全靠猜测所得到的视频逼真得多的画面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →