← 最新论文
💻 computer science

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

本文介绍了 ByDeWay-V2,这是一个无需训练的框架,它通过将显式的、人类可读的成对几何关系与深度线索相结合,增强了多模态大语言模型在决策关键型应用中的空间推理能力和可解释性,从而在严格的资源约束下高效运行的同时,显著减少了幻觉并提升了在空间基准测试上的性能。

原作者: Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何观察世界。这个机器人不仅仅是一个摄像头;它是一个“多模态大语言模型”(简称 MLLM),一种能够观察图片并进行描述、回答问题甚至做出决策的人工智能类型。把它想象成一个极其聪颖的学生,虽然读遍了图书馆里的每一本书,但从未真正走出门外。因为它主要通过文本进行学习,所以它有时会对物理世界产生误解。它可能会自信地告诉你一只猫正坐在桌子上,而实际上在照片中,那只猫是在桌子下面。这种错误被称为“幻觉”。

在现实世界中,这些错误可能是危险的。如果一个机器人被要求拿起杯子而不碰倒它,或者如果安全系统需要识别站在移动汽车前的人,那么“大致正确”是不够的。我们需要机器人做到精准,而且同样重要的是,我们需要知道它为什么做出那个决定。我们能信任它吗?科学家们正在提出的核心问题是:我们如何阻止这些人工智能模型在空间和位置方面编造事实,以及我们如何让它们的思维过程变得足够清晰,以便人类进行检查?

这正是这一篇新论文发挥作用的地方,它提出了一个名为 ByDeWay-V2 的巧妙且低成本的解决方案。研究人员意识到,以往修复这些机器人的尝试有点像是给它们一张模糊的地图。它们知道物体大概有多远(比如“近”、“中”、“远”),但并不清楚一个物体相对于另一个物体的确切位置。这就像知道一个人和一台冰箱都在房间的“最近”区域,但不知道那个人是站在冰箱“旁边”还是在冰箱“里面”。

为了解决这个问题,团队构建了一个系统,充当机器人眼睛的“超级组织向导”。在机器人尝试回答问题之前,系统会先快速拍摄一张场景照片,并使用一种专门的工具(称为 YOLO-World-L)在它看到的每个物体周围画出隐形的框。然后,它进行一些快速的数学计算来确定精确的几何关系:“杯子在笔记本电脑左侧 5 英寸处”,或者“猫正碰着花瓶”。它将这些数学事实转化为简单易懂的人类语言句子,并将它们直接作为一份“小抄”喂给机器人。

结果非常令人印象深刻。当他们在不同的 AI 模型上测试这种新方法时,提升幅度是巨大的。对于一个较小、较轻量级的模型 BLIP-Base,该系统将一个接近随机猜测的表现(得分 0.05)转变为稳健且具有竞争力的表现(得分 0.53)。在 BLINK 这个专门考察物体相对位置关系的难题测试中,该系统帮助一个顶尖模型提升了 46% 的分数。或许对于实际应用来说最令人兴奋的是,整个过程不需要重新训练机器人,也不需要使用庞大的超级计算机。他们系统中最轻量级的版本可以在标准计算机处理器(CPU)上运行,且使用的“记忆”(Token)不足 40 个词,这证明了你不需要一个巨大的大脑也能拥有对空间清晰且可靠的理解。

简而言之,ByDeWay-V2 不仅仅是让机器人变得更聪明,它还让机器人变得更诚实。通过为它提供关于物体位置的明确、循序渐进的证据,机器人不再靠猜测,而是开始解释其推理过程,从而使其在我们需要它执行的关键任务中变得更加安全和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →