← 最新论文
🤖 AI

CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation

本文提出了 CRePE,一种新颖的位置编码方法,该方法利用弯曲射线期望和几何注意力适配器,在视频生成中实现统一的、稳定的相机控制与外部几何条件约束,从而有效解决了现有基于小孔成像的编码方法在广角和鱼眼镜头应用中的局限性。

原作者: Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位机器人艺术家如何绘制一个动态的视频场景。你需要确切地告诉机器人相机该如何移动(向左平移、放大、旋转),以及使用何种“镜头”(例如标准相机、拉伸边缘的广角镜头,或让一切看起来像气泡的鱼眼镜头)。

以往机器人艺术家的问题在于,它们只理解相机朝向的方向,却不理解该方向上物体的距离。这就像给某人一个指南针,告诉他“北方”,却不告诉他一座山是在 1 英里外还是 100 英里外。当相机移动时,机器人会搞不清物体应该在哪里,尤其是在使用鱼眼镜头等会扭曲世界的怪异镜头时。

本文介绍了一种名为CRePE(弯曲射线期望位置编码)的新工具来解决这个问题。以下是其工作原理,使用简单的类比说明:

1. “模糊手电筒”与“激光笔”

旧方法就像激光笔。它们从相机到图像中的特定点画一条直线,并说:“这个像素就在这里。”这对普通相机尚可适用,但在广角或鱼眼镜头下会失效,因为这些镜头像哈哈镜一样弯曲光线。直线无法匹配弯曲的现实。

CRePE则像模糊手电筒。它不是说“这个像素确切在 X 点”,而是说“这个像素位于这条弯曲路径上的某处,很可能在这些距离之间”。它在视线方向上创建了一个物体可能存在的“概率云”。这使得机器人能够理解,在使用鱼眼镜头时,通往物体的路径不是一条直线,而是一条曲线。

2. 视频 Token 的“智能 GPS"

在 AI 视频生成中,图像被分解为称为"Token"的微小拼图块。

  • 旧方法:机器人知道每个拼图块朝向哪个方向,但不知道它在场景中有多深。
  • CRePE 方法:CRePE 为每个拼图块赋予一个“智能 GPS"标签。它预测该块的距离不确定性范围。它告诉机器人:“这条街道的这块很可能在 5 米外,上下浮动 1 米。”

3. “中层管理”策略

论文测试了将这种新的“智能 GPS"放置在机器人大脑(即庞大的神经网络)中的位置。

  • 他们发现,将其放在过程的开始或结束处效果不佳。
  • 最佳位置:他们发现大脑的中间层是放置此信息的最佳位置。这就像拥有一位中层经理,他了解项目的细节(几何结构),并能在最终产品完成之前完美地组织工人(Token)。

4. “辅助轮”(伪监督)

为了教会机器人这项新技能,研究人员使用了一套“辅助轮”系统。他们利用一个独立的、预先存在的 AI(“几何基础模型”)来猜测训练视频中的距离。

  • 他们没有强迫机器人完美地复制这些猜测。
  • 相反,他们将这些猜测用作安全网。如果机器人的猜测大错特错,安全网会将其推回现实。如果安全网的猜测很糟糕(例如看着模糊的天空),机器人则被允许相信自己的判断。

5. 结果:拥有弯曲镜头的更佳电影

当他们测试 CRePE 时:

  • 更好的相机控制:视频更准确地遵循了所请求的相机移动,特别是在广角和鱼眼镜头下。
  • 更好的几何结构:随着相机移动,视频中的物体保持在正确的位置,没有发生扭曲或奇怪地漂浮。
  • 额外功能:由于机器人现在如此精通“距离”,你实际上可以替换来自不同视频的距离图。这让你可以将一个视频的运动与另一个视频的世界形状结合起来,创造出以前不存在的新场景。

总结:
CRePE 是一种教导 AI 视频生成器理解深度弯曲镜头的新方法。AI 不再仅仅知道朝哪个方向看,而是知道物体有多远,从而使其能够在使用疯狂、失真的相机镜头时,也能创作出流畅、逼真的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →