← 最新论文
🤖 AI

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

本文提出了 LAST 框架,通过构建可交互的 LAST-Box 沙箱将异构工具调用抽象为原子指令与空间技能,并配合三阶段渐进式训练策略,有效解决了多模态大模型在空间推理中面临的幻觉与精度不足问题,显著提升了其在复杂几何布局任务上的表现。

原作者: Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LAST 的新方法,旨在解决人工智能(特别是多模态大语言模型)在“空间推理”方面的短板。

为了让你轻松理解,我们可以把这篇论文的核心思想想象成**“给一个博学但方向感极差的天才,配了一位专业的导航员和一套精密的测量工具”**。

以下是用通俗语言和生动比喻对这篇论文的解读:

1. 核心问题:天才的“方向感”失灵

想象一下,现在的多模态大模型(MLLMs)就像是一个读过万卷书、看过万张图的“博学天才”。它能认出图片里是一只猫还是一只狗,也能理解复杂的语义。

但是,当被问到一些具体的空间问题时,比如:

  • “那个沙发离冰箱有多远?”
  • “这个杯子大概有多高?”
  • “如果我从左边看,那个物体在哪个方向?”

这个“天才”就会开始**“一本正经地胡说八道”**(也就是论文里说的“幻觉”)。它虽然知道什么是沙发,但完全搞不清它们之间的几何关系、距离和深度。就像让一个只懂理论物理的教授去开挖掘机,他懂原理,但手眼协调不行,容易把东西挖坏。

2. 为什么以前的方法不管用?

以前的做法是试图通过**“死记硬背”**(数据训练)来让模型变强。这就好比让那个教授每天看一万张带有距离标注的图片,试图让他“悟”出距离感。

  • 结果:效果有限。因为空间感是一种需要精确计算的“硬技能”,光靠看图片很难内化成一种直觉。

3. LAST 的解决方案:给天才配个“工具箱”

作者们想出了一个聪明的办法:既然模型自己算不准,那就让它去调用专业的“工具”来帮忙。

这就好比,那个“博学天才”不需要自己学会怎么测量,他只需要知道**“什么时候该叫谁来帮忙”**。

核心组件一:LAST-Box(智能工具箱)

这是论文最精彩的部分。作者没有直接把复杂的底层代码扔给模型,而是把各种专业的视觉工具(比如测深度的、画框框的、分割物体的)打包成了**“原子技能”**。

  • 比喻
    • 以前的做法:让模型直接去操作一台复杂的数控机床(调用底层 API),模型很容易按错按钮,导致机器乱转。
    • LAST 的做法:把机床封装成了一个**“一键测量按钮”。模型只需要说:“帮我量一下这个桌子的深度”,工具箱就会自动调用专业的深度测量仪,把结果整理成一张“带标注的图”和一段“人话描述”**,直接递给模型。
    • 好处:模型不再需要处理复杂的代码参数,它只需要看懂工具返回的“提示”(Hints),就像看一张画了辅助线的地图一样简单。

核心组件二:三步走训练法(循序渐进)

为了让模型学会使用这个工具箱,作者设计了一个像**“驾校培训”**一样的三阶段训练:

  1. 热身阶段(Warm-up)

    • 比喻:先让模型看各种“辅助线”和“深度图”,教它:“看,这张图上的颜色深浅代表距离远近,那个框框代表物体位置。”
    • 目的:让模型先看懂工具给出的提示,别把深度图当成普通的纹理。
  2. 监督微调(SFT)

    • 比喻:教练带着练。给模型出题,然后手把手教它:“遇到这种问题,先按‘测量距离’按钮,看了结果后再回答。”
    • 目的:教会模型什么时候该用工具,以及怎么根据工具的结果来回答问题。
  3. 强化学习(RL)

    • 比喻:放手让模型自己练。如果它用对了工具且答对了,就奖励;如果它乱用工具或者答错了,就惩罚。
    • 目的:让模型学会灵活组合工具。比如,它可能会发现:“哦,原来先测距离,再结合图片裁剪,能更准地判断大小。”

4. 实验结果:小模型也能打败大模型

论文在四个不同的测试集上进行了验证,结果非常惊人:

  • 效果提升:经过训练的 70 亿参数模型(LAST-7B),在空间推理任务上比它原本的样子提升了约 20%
  • 吊打巨头:这个只有 70 亿参数的小模型,竟然在空间推理能力上超过了很多闭源的、参数巨大的商业巨头模型(如 GPT-5.1 和 Gemini 2.5 Pro)。
  • 原因:因为它学会了“借力”。它不需要自己变强,它只需要学会如何正确地使用“专业工具”来弥补自己的短板。

5. 总结

这篇论文的核心思想就是:不要试图让大模型重新发明轮子(重新学习所有几何知识),而是给它配一套好用的“轮子”(工具),并教会它如何正确地使用这些轮子。

  • 以前:模型靠猜,经常猜错。
  • 现在 (LAST):模型靠查(查工具),查得准,答得对。

这就好比,你不需要自己成为数学天才才能解出复杂的几何题,你只需要学会如何使用计算器,并且知道什么时候该按哪个键。LAST 就是那个教会 AI 使用“空间计算器”的聪明老师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →