想象一下,你正在教一个机器人如何理解世界。目前,大多数机器人就像那些只在单一、光线完美的教室里学习过的学生。它们非常擅长知道那间房间里椅子在哪里,但如果你给它们看工作台上的一个小螺丝,或者无人机俯瞰城市公园的视角,它们就会完全困惑。它们不明白,房间里的“椅子”与地图上的“椅子”是不同的,也不明白“微小物体”需要与“宏大景观”不同类型的“眼睛”。
论文SpaceVista提出了一种新方法,教导机器人以各种尺寸来观察和推理空间,从小如沙粒(毫米级)到大至整个街区(公里级)。
以下是他们解决方案的分解,使用了简单的类比:
1. 问题:“一刀切”的陷阱
当前的 AI 模型就像一个人戴着适合阅读小书的阅读眼镜,却试图阅读城市地图。
- 差距: 先前的研究主要集中在室内房间(如客厅)。它们在处理微小物体(如螺丝)或巨大物体(如无人机拍摄的森林视角)时显得力不从心。
- 困惑: 如果你在没有特殊处理的情况下,同时用微小螺丝和巨大建筑物来训练模型,模型就会变得“困惑”。它可能会认为螺丝和建筑物一样大,因为它试图将相同的规则应用于所有事物。这被称为知识冲突。
2. 解决方案:“瑞士军刀”式的方法
作者构建了一个完整的系统来解决这个问题,该系统由三个主要部分组成:
A. 图书馆:SpaceVista-1M(数据集)
这就像建立一个涵盖所有尺度的海量视频图书馆。
- 他们做了什么: 他们不仅仅是扫描房间,而是收集了38,000 个视频场景,范围从微小的桌面到城市的无人机航拍。
- 规模: 他们针对这些视频创建了100 万个问答。
- 例如: “螺丝离螺母有多远?”(微小尺度)对比“公园有多大?”(巨大尺度)。
- 技巧: 他们使用自动化工具(如专用机器人)来测量距离和计数物体,但也让人类对最难的部分进行双重检查,以确保答案是物理上正确的。
B. 大脑:SpaceVista-7B(模型)
这就是 AI 模型本身。为了防止上述的“困惑”,他们没有一次性将所有数据灌入大脑。
- “专家”系统: 想象一家医院,医生不会试图同时成为所有领域的专家。相反,他们有一个路由器(像接待员一样),决定呼叫哪位专家。
- 如果问题是关于微小螺丝的,路由器会将其发送给“微观专家”。
- 如果问题是关于无人机视角的,它会被发送给“宏观专家”。
- 结果: 模型学会了根据场景的大小切换“档位”,防止它将毫米与公里混淆。
C. 训练:渐进式奖励
在训练模型时,他们不仅仅是说“对”或“错”。他们教导模型一步步思考,就像人类一样。
- 过程: 在回答“有多远?”之前,模型会因为先说“我看到一张桌子”,然后说“我看到尺度很小”,最后再计算距离而获得奖励。
- 锚点: 他们使用“尺度”作为锚点。如果模型意识到它正在观察一个微小物体,它会在尝试猜测距离之前先锁定这一事实。这阻止了它胡乱猜测。
3. 结果:通过“现实世界”测试
作者使用一种名为SpaceVista-Bench的新且严格的测试,将他们的新型模型与其他顶级 AI 模型进行了对比。
- 测试: 这不仅仅是一个选择题测验;它是对现实世界测量值(如检查尺子或地图)的严格核查。
- 结果: SpaceVista-7B 的表现显著优于其他模型,特别是在微小物体和大型户外场景这些棘手领域。这表明,通过教导 AI 尊重世界的尺度,它可以更好地理解世界。
总结
简而言之,SpaceVista是一个新工具包,它教导 AI 停止将世界视为单一的、扁平的画面。相反,它教导 AI 根据是在看螺丝还是摩天大楼,来佩戴不同的“镜头”,确保它理解我们真实、多尺度世界中事物的真实大小和距离。
技术摘要:SpaceVista——从毫米到公里的全尺度视觉空间推理
1. 问题陈述
当前视觉空间推理的进展主要集中在室内场景和特定物体尺度上,往往依赖于劳动密集型的人工 3D 扫描和手动标注。现有模型难以应对从毫米级制造到公里级无人机感知等多样化的现实世界应用。该领域面临两大主要挑战:
- 数据局限:过度依赖室内 3D 扫描,且跨多种尺度(毫米至公里)构建具有精确物理标注的大规模“野外”视频数据集的成本高昂。
- 模型局限:缺乏全尺度建模导致模型在单一场景(通常是室内)上过拟合,且当模型尝试在截然不同的尺度间进行推理时会产生知识冲突(例如,混淆螺丝与建筑物的大小)。当前的多模态大语言模型(MLLM)往往缺乏将空间理解从微观物体泛化到宏观场景的能力。
2. 方法论
作者提出了一套整体解决方案,包括一个新数据集、一个基准测试以及一种专门的模型架构。
2.1. 数据集构建:SpaceVista-1M
为解决数据稀缺和标注成本问题,作者开发了一个自动化流程,利用专业模型来构建 SpaceVista-1M,该数据集包含源自 38,000 个视频场景 的 100 万个空间问答对。
- 尺度覆盖:数据集涵盖五个空间尺度:微小桌面(毫米级)、桌面(厘米级)、室内(米级)、户外(10 米级)和无人机(100 米以上)。
- 任务多样性:涵盖 19 种多样化任务,包括通用空间推理(距离、计数、关系)和特定尺度任务(例如,桌面操作规划、无人机视角的面积估算)。
- 标注策略:该流程整合了相机内参/外参、度量深度估计(使用 Metric3Dv2 和 UniDepthV2 等模型)以及物体跟踪(SAM 2 + Grounding DINO),以生成结构化的 2D/3D 标注。
- 质量控制:虽然训练集采用自动化生成并辅以人工验证(实现约 83% 的全局准确率),但评估基准则依赖于严格的人工测量和来源验证。
2.2. 基准测试:SpaceVista-Bench
为确保与物理世界精确对齐的评估,作者手工构建了 SpaceVista-Bench。
- 构建方式:该基准涉及手动记录和测量现实世界物体(针对微小/桌面场景),并检索权威数据(如维基百科、官方设计文档)以获取地标和户外场景信息。
- 范围:包含约 1,600 个问答对,覆盖约 300 个独特的视频场景,涵盖全部五个尺度。
2.3. 模型架构:SpaceVista-7B
提出的模型 SpaceVista-7B 基于 Qwen2.5-VL-7B 基础构建,并引入了三项关键创新以处理全尺度推理:
- 超越语义(稠密特征融合):为了克服仅依赖语义 Tokenizer 的局限性,该模型集成了来自 DINOv3(一种以深度和法线表示著称的自监督视觉模型)的稠密特征。这些特征通过交叉注意力机制与标准视觉编码器融合,提供基于几何和深度的空间理解。
- 尺度感知专家(类 LoRA 机制):为缓解“知识冲突”(即相似的视觉模式在不同尺度下暗示不同的物理现实),模型采用了 混合专家(MoE) 方法。具体而言,它针对不同尺度使用类 LoRA 适配器,并由 尺度路由器 动态路由。这使得模型能够在保持参数高效的同时,为每个尺度维护独立的知识。
- 渐进式奖励强化学习:训练策略包含使用 组相对策略优化(GRPO) 的强化学习(RL)阶段。奖励函数设计有“锚点”,以强制模拟人类的推理过程:
- 语义锚点:识别参考物体。
- 尺度锚点:估计全局场景尺度。
- 答案锚点:确保最终答案在逻辑上得以推导。
这种渐进式奖励结构引导模型遍历可靠的思维链(CoT)路径,而非直接跳跃得出结论。
3. 主要贡献
- SpaceVista-1M:首个开源的全尺度空间推理数据集,包含跨越 5 个尺度和 19 个任务的 100 万个问答对,支持带有推理依据的监督微调(SFT)和强化学习(RL)。
- SpaceVista-7B:一种空间推理模型,融合了丰富的几何信息,并采用具有渐进式奖励训练策略的特定尺度专家,以缓解跨尺度冲突。
- SpaceVista-Bench:一个高精度、人工标注的基准测试,覆盖所有尺度,通过手动测量和权威来源检索构建而成,提供了可靠的评估标准。
4. 实验结果
作者在五个基准测试上将 SpaceVista-7B 与最先进的闭源模型(如 GPT-5、Gemini-2.5-pro)和开源模型(如 InternVL、Qwen2.5-VL、SpaceR)进行了评估。
- 性能表现:SpaceVista-7B 在现有基准测试(如 VSI-Bench)上表现出竞争力,并在全尺度 SpaceVista-Bench 上取得了 显著更优的结果。
- 提升幅度:在 SpaceVista-Bench 上,该模型比专有和开源基线模型平均高出 3% 以上,与规模相似的开源模型相比,在综合全尺度推理方面实现了 约 6% 的显著改进。
- 消融研究:
- 尺度专家:引入特定尺度的 LoRA 专家显著提升了性能,证实了分离尺度级知识可减轻干扰。
- 渐进式奖励:基于锚点的奖励设计比无约束的推理路径产生了更高的性能。
- 模态:引入 DINOv3 特征比使用 VGGT 带来了更大的提升,突显了自监督稠密特征在空间任务中的价值。
5. 意义与主张
本文主张 SpaceVista 代表了迈向 稳健全尺度空间智能 的基础性一步。通过弥合从毫米级操作到公里级遥感的差距,该工作使智能体能够在无约束的真实世界环境中感知和推理。
作者将其工作定位为以下多样化领域的催化剂:
- 微观尺度:精密制造和医疗手术。
- 宏观尺度:自动驾驶、基于无人机的感知和制图。
本文强调,虽然当前模型局限于室内或单尺度设置,但 SpaceVista 提供了必要的数据、基准和架构范式,以推动跨越物理尺度全谱系的空间推理发展。作者指出,尽管目前的覆盖范围广泛,但尚未完全解决极端尺度(例如纳米级半导体生产或 10 公里以上的卫星制图),为未来的扩展留下了空间。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。