← 最新论文
💻 computer science

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

本文提出了多视图关系蒸馏(Multi-View Relational Distillation, MVRD),这是一种通过从具备几何基础的教师模型中蒸馏跨视图的补丁级余弦相似度,从而在增强视觉语言模型几何推理能力的同时,保持预训练语言对齐并避免特征融合带来的计算开销的方法。

原作者: Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人理解世界。你给了它一个摄像头和一个麦克风,你希望它不仅仅是识别出“杯子”或“椅子”,还要理解这些物体在三维空间中的位置、它们之间的距离以及它们是如何相互关联的。这就是**视觉语言模型(Vision-Language Models, VLMs)**的世界。把这些模型想象成那些读遍了图书馆里每一本书、看过数百万张图片的超级聪明的学生。它们非常擅长将文字与图像进行匹配——比如知道“狗”这个词对应的是一张毛茸茸动物的照片。但问题在于,尽管它们在语言方面非常出色,但在几何学方面却往往表现得很糟糕。它们可能知道“微波炉”长什么样,但很难弄清楚微波炉是在烤面包机的左边还是右边,或者它的实际尺寸有多大。这对需要实地导航的机器人、自动驾驶汽车和 AI 助手来说是一个巨大的问题。科学家们一直试图通过教授这些模型几何知识来解决这种“空间盲视”问题,但传统的方法就像是通过更换整栋房子来修理漏水的屋顶:它们要么破坏了模型理解语言的能力,要么让模型变得过于庞大且缓慢,以至于无法处理实时任务。

于是,出现了一个被称为*多视角关系蒸馏(Multi-View Relational Distillation, MVRD)*的新想法,由研究员 Kiet T. Nguyen 及其同事提出。他们不再强迫学生模型去死记硬背老师知识的精确“形状”(这会破坏其语言能力),而是决定教它事物之间的“关系”。想象一下你正在试图教某人一个城市的布局。旧的方法是强迫他们记住每栋建筑的精确 GPS 坐标。如果坐标稍微错了一点,他们可能会迷失方向,甚至忘记面包店在哪里。而新的方法 MVRD 则像是说:“别担心精确的坐标。只要记住面包店在公园旁边*,而图书馆在面包店的马路对面*即可。”通过关注这些相对的连接(即“关系”)而非绝对的位置,模型学会了理解空间,同时又没有失去说话和理解语言的能力。

研究人员在名为 LLaVA-Video-7B 的模型上测试了这一方法。他们将这种新方法与旧的“特征蒸馏”(即坐标记忆法)进行了对比。结果显而易见:旧方法虽然提高了模型的几何能力,却导致它在简单的语言任务(如计数物体或追踪物体出现的先后顺序)上失败了。这就像是一个能画出完美地图却忘了如何阅读路标的学生。相比之下,MVRD 显著提升了模型的空间推理能力——将其在空间推理测试(VSI-Bench)上的平均准确率提高到了标准版本的 59.9% 和特殊“双路径(Dual Pathway)”版本的 60.4%,同时保持了其语言能力完好无损。事实上,这种新方法仅比使用庞大独立几何引擎的最佳现有方法差距 0.5 个百分点,但它使用的额外参数极少(仅为 0.19B),且延迟(latency)更低。

论文指出,通过关注多个场景视角下的“余弦相似度”(一种衡量不同信息之间角度相似程度的数学方法),模型可以学习到三维空间的“骨架”,而不会覆盖其语言理解的“血肉”。这种方法也被证明具有鲁棒性,能够很好地适配不同类型的基座模型,并能泛化到复杂的 3D 任务中,例如在房间内寻找特定物体或详细描述一个场景。本质上,研究人员发现了一种方法,可以在不让 AI 忘记如何交谈的前提下,赋予其方向感和深度感,为机器人导航物理世界提供了一条更轻量、更快且更智能的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →