← 最新论文
💻 computer science

A Unified Formula for Affine Transformations between Calibrated Cameras

本技术报告推导出了两个已标定视图中局部图像块之间仿射变换的闭式表达式,证明了该变换取决于相对相机位姿、图像坐标以及局部表面法线。

原作者: Levente Hajder

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Levente Hajder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的左手拿着一台相机,右手也拿着一台相机,两台相机都对着世界上的同一个物体。这就是一个“立体视觉设置”(stereo setup)。现在,想象你从左侧图像中取出一个微小的正方形像素块,并试图弄清楚这个像素块在右侧图像中看起来是什么样子的。

通常情况下,如果物体是像墙壁一样平坦的,这个像素块只会发生可预测的位移或拉伸。但如果物体是弯曲的,比如一个球或一块凹凸不平的岩石,那么这个微小的像素块就会发生复杂的扭曲。

Levente Hajder 的这篇论文本质上就是一套用于精确预测这种扭曲是如何发生的**“万能食谱”**。

以下是使用简单类比进行的详细拆解:

1. 三种原料

作者指出,要预测这种扭曲,你只需要三种特定的信息:

  • 相机是如何移动的: 你是转动了相机?还是把它向侧面滑动了?(论文中称之为“相对位姿”,即 relative pose)。
  • 你在看哪里: 我们讨论的是屏幕上的哪个特定位置?(即“图像坐标”,image coordinates)。
  • 物体是如何朝向的: 在那个精确的点上,表面是平坦的、倾斜的还是弯曲的?(即“表面法线”,surface normal,就像是从物体表面垂直刺出的一个箭头)。

2. “神奇公式”

在这篇论文发表之前,如果你想计算一个像素块如何扭曲,你可能需要针对不同情况使用不同的数学公式(例如:一个公式处理平坦的墙壁,另一个处理移动的相机,还有一个处理旋转的相机)。

这篇论文提供了一个统一的公式(文中第 5 个等式),它适用于所有情况。这就像拥有一个可以控制所有品牌电视的通用遥控器,而不是为三星、索尼和 LG 各准备一个不同的遥控器。

该公式将那三种原料(移动、位置和表面角度)混合在一起,生成一个 2x2 的数字网格(一个矩阵)。你可以把这个网格看作是一份“拉伸说明书”。它会准确地告诉你如何挤压、拉伸或倾斜微小的像素块,以匹配第二台相机所看到的景象。

3. 它是如何运作的(解构)

作者将这个复杂的数学过程分解为三个相加的简单部分:

  1. 旋转部分: 解释了相机是如何转动的。
  2. 平移部分: 解释了相机是如何向侧面或向前移动的。
  3. 表面部分: 解释了物体本身的形状。

论文表明,最终的“拉伸指令”仅仅是这三个影响因素之和。

4. “标准立体视觉”测试

为了证明这个公式有效,作者在一个非常简单、经典的场景中对其进行了测试:两台相机并排坐在一起,直视前方(就像人类的双眼)。

  • 在这种简单的情况下,复杂的公式会简化为一个更短的等式。
  • 结果与之前专家们发现的针对该特定简单情况的结论完全吻合。
  • 这证明了“万能食谱”是正确的,因为当你用它来做一道简单的菜时,它的味道与已知的旧食谱完全一致。

总结

简而言之,这篇论文为计算机视觉提供了一个单一的、通用的工具,用以理解 3D 形状从两个不同角度观察时的差异。你不再需要为每种相机运动或物体形状准备不同的数学技巧,现在你可以使用这一个“统一公式”来计算任何局部图像块的畸变,只要你知道相机是如何移动以及物体是如何定向的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →