← 最新论文
🤖 AI

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

本文介绍了 RuleMaze,这是一个用于评估多模态大语言模型中符合规则的视觉空间规划能力的受控基准测试,并提出了一个混合规则生成框架以及一种解耦多模态规划(DMP)方法,该方法通过将感知、执行和验证分离,显著提高了规则遵循能力和泛化能力。

原作者: Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:计算机不仅能观察一张图片并理解其中包含什么,还能理解如何从中穿行。这就是多模态大语言模型的承诺——这是新一代的人工智能,它将阅读与推理的能力与视觉能力结合在一起。这些系统已经学会了描述图像、回答关于照片的问题以及解决视觉谜题。但它们的知识中存在一个缺口。虽然它们可以导航一条简单的路径,但当路径被一组随时刻变化的特定指令所阻挡时,它们就会感到吃力。在现实世界中,自动驾驶汽车或机器人助手不仅必须找到从 A 点到 B 点的方法,还必须遵守不断变化的规则,例如“红灯时不得左转”或“避开湿滑地面”。目前的模型在这些方面经常失败,它们将规则视为建议而非硬性约束,或者在规划下一步行动时完全忘记了规则。

为了理解为什么这如此困难,研究人员于陈(Yu Chen)及其领导的北京大学与银旺智能技术(Yinwang Intelligent Technology)团队创建了一个新的测试场,名为 RuleMaze。他们构建了一个充满迷宫的数字环境,但这些迷不仅仅是墙壁和开放空间的拼图。每个迷宫都附带了一套独特的自然语言规则,以纯英文编写,精确地规定了角色可以如何移动。有些规则很简单,比如“你不能踩在粉色方块上”。另一些则很复杂,要求角色记住它曾经去过的地方,或者根据其当前位置改变行为,例如“如果你正站在橙色方块上,你的下一步必须向上移动”。研究人员使用一种方法生成了数千个此类场景,该方法能自动将人类编写的规则转化为严格的、机器可检查的逻辑。这使得他们能够测试人工智能是否能在导航视觉空间的同时,真正理解并遵循规则,而不仅仅是根据以前见过的模式来猜测正确的路径。

该团队发现,仅仅要求一个强大的模型观察迷宫并写下一系列移动步骤并不能奏效,尤其是在规则是全新的或复杂的时。当规则发生变化时,模型往往会忘记指令,或者在没有意识到情况的情况下违反规则。为了解决这个问题,研究人员提出了一种被称为“解耦多模态规划”(Disentangled Multimodal Planning)的新思维方式。他们不再强迫模型一次性完成所有工作——即同时进行观察图片、思考规则和决定下一步——而是将任务分解为三个独立的、清晰的工作。首先,模型使用一个工具来观察迷宫,识别自己所处的位置以及附近有哪些特殊符号。第二,它使用一个工具尝试一次移动,并观察新的画面是什么样的。第三,也是最重要的一点,它使用一个专门的工具来检查它刚刚进行的移动是否遵循了规则。这个检查工具就像一个严格的裁判,在模型被允许继续之前,会对每一步动作立即给出“是”或“否”的判断。

这种方法戏剧性地改变了结果。在测试中,这种新方法使模型在处理从未见过的任务时,规则遵循成功率达到了 90%,相比之下,以往的方法在面对新规则时往往会完全失败。研究人员发现,当模型被强制要求在每一步都检查自己的工作时,它就不再犯那种试图在脑海中规划整个旅程而不在每一步都进行验证时所产生的错误。模型学会了停顿、观察规则、检查移动,然后才继续前进。即使规则很困难,涉及多个条件或要求模型记住它沿途拾取的物品,这种方法依然有效。这项研究表明,对于人工智能要在复杂的、受规则约束的环境中实现真正的可靠性,它不能仅仅是一个聪明的猜测者;它必须配备一个系统,迫使它根据所导航世界的约束条件来验证自己的行为。通过将观察、移动和检查的行为分离,研究人员展示了机器可以学会遵循指令,并达到一种此前无法企及的纪律水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →