← 最新论文
💻 computer science

Token Warping Helps MLLMs Look from Nearby Viewpoints

该论文提出了一种名为“Token Warping”的新方法,通过直接对 ViT 架构中的图像 Token 进行后向扭曲而非传统的像素扭曲,显著提升了多模态大语言模型(MLLMs)在视角变化下的鲁棒性与推理能力,并在其提出的 ViewBench 基准测试中超越了现有基线模型。

原作者: Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让多模态大语言模型(MLLMs)变得更聪明、更懂“空间感”的新方法。为了让你轻松理解,我们可以把这篇论文的核心思想想象成**“从看照片到看 3D 模型”**的转变。

1. 核心问题:为什么现在的 AI 看照片会“晕”?

想象一下,你给 AI 看一张照片(View A),照片里有一个杯子在书的右边
然后你问 AI:“如果你往右走一步,换个角度(View B)看,杯子和书的位置关系会变吗?”

  • 普通 AI 的困境:现在的 AI 就像是一个只会看平面照片的人。如果你让它想象换个角度,它通常会尝试把照片里的像素点强行“拉扯”到新的位置(这叫像素扭曲)。
    • 比喻:这就像你试图把一张印在纸上的画,强行拉伸变形来模拟 3D 效果。结果往往是画里的东西被拉得面目全非,书变扁了,杯子变长了,AI 看着这一团乱麻,根本认不出原来的东西,也就无法回答正确的问题。
    • 原因:AI 对深度(距离)的估算哪怕有一点点误差,在像素层面被放大后,就会变成巨大的几何扭曲。

2. 新方案:Token Warping(令牌扭曲)

这篇论文的作者提出,我们不应该去扭曲像素(Pixel),而应该去扭曲令牌(Token)

  • 什么是 Token?

    • 像素是照片的最小颗粒,像马赛克里的一个小色块。
    • Token是 AI 理解图片的方式。AI 把图片切成很多小块,每一块不仅包含颜色,还包含**“这是什么东西”**的语义信息。
    • 比喻:如果把图片比作一袋乐高积木,像素就是组成积木的塑料颗粒,而 Token 就是已经拼好的一个个小部件(比如一个轮子、一个窗户、一个人头)。
  • Token Warping 是怎么做的?

    • 当 AI 需要想象“换个角度看”时,它不是去拉扯那些细小的塑料颗粒(像素),而是直接搬运已经拼好的乐高部件(Token)
    • 比喻:想象你在玩一个 3D 拼图游戏。
      • 旧方法(像素扭曲):试图把拼好的房子强行压扁或拉长,结果房子塌了。
      • 新方法(Token 扭曲):把拼好的“窗户”、“门”、“屋顶”这些部件,根据新的视角,重新排列组合。因为部件本身是完整的,所以无论怎么摆,窗户还是窗户,不会变形成一滩水。

3. 关键发现:向后看比向前看更稳

论文中比较了两种搬运 Token 的策略,发现**“向后搬运”(Backward Warping)**效果最好。

  • 向前搬运(Forward):拿着源视角的 Token,硬塞到新视角里。
    • 问题:就像把旧照片里的东西硬塞进新相框,结果新相框里有很多空白(因为有些角度看不到),或者东西挤在一起,导致 AI 看到的画面是稀疏、破碎的。
  • 向后搬运(Backward):先在新视角画好一个整齐的网格,然后问源视角:“在这个新位置,我应该从旧照片里拿哪个 Token 过来?”
    • 优势:这就像**“按需取货”**。新视角的每一个格子都填满了从旧照片里找来的、最合适的完整部件。这样拼出来的新画面,整齐、连贯、没有空洞

4. 实验结果:AI 真的变聪明了

作者做了一个叫 ViewBench 的考试,专门考 AI 能不能在视角变化后还能认对东西。

  • 考题示例
    • 图 A:杯子在书右边。
    • 问题:如果往右转 45 度(图 B),杯子还在书的右边吗?
  • 结果
    • 普通 AI(像素扭曲):看着变形的图,瞎猜,经常答错。
    • 生成式 AI(画新图):试图重新画一张图,但经常画错(比如把杯子画没了,或者画个不存在的物体)。
    • Token Warping AI:因为它搬运的是完整的“语义部件”,所以它能精准地告诉你:“虽然角度变了,但杯子依然在书的右边(或者变成了左边,取决于具体几何关系),而且它还是那个杯子。”

5. 总结:为什么这很重要?

这项技术就像给 AI 装上了一副**“心理旋转”的眼镜**。

  • 以前:AI 看照片是死板的,换个角度它就“瞎”了。
  • 现在:AI 学会了像人类一样,在脑海里把看到的物体拆解成有意义的部件,然后灵活地重组它们,从而理解**“如果我从旁边看,世界会变成什么样”**。

一句话总结
这篇论文告诉我们要想让 AI 真正理解 3D 空间,不要让它去折腾那些细碎的像素点,而要让它学会搬运和重组那些**“有含义的图像块”**。这就像教孩子认路,不是教他数地上的砖块,而是教他认路标和建筑物,这样无论他走到哪个角度,都能认得出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →