← 最新论文
🤖 AI

2.5-D Decomposition for LLM-Based Spatial Construction

本文提出了一种利用 2.5 维分解的神经符号流水线,通过将模型限制在二维规划而由确定性执行器处理垂直放置,显著提升了基于大语言模型的空间构建精度,在基准测试中实现了接近上限的性能,并证明了其向边缘硬件及多样化协作任务的成功迁移。

原作者: Paul Whitten, Li-Jen Chen, Sharath Baddam

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Whitten, Li-Jen Chen, Sharath Baddam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个非常聪明但略显笨拙的机器人,如何根据口头指令(例如“搭建一个 T 形结构,并在顶部添加一个紫色方块”)用彩色积木搭建一座塔。

问题在于,虽然机器人的大脑(大型语言模型,即 LLM)非常擅长理解形状的概念,但它极不擅长计算在三维空间中放置积木的数学位置。它经常忘记重力的存在,将积木堆叠在半空中,或者算错堆叠的高度。

本文提出了一种名为2.5 维分解的巧妙解决方案。以下是其工作原理,通过简单的类比来说明:

问题:笨拙的“建筑师”

将 LLM 想象为一位才华横溢的建筑师,他能在纸上绘制出完美的二维蓝图。他确切地知道墙壁在平面图中应该位于何处。然而,如果你要求这位建筑师同时计算三维塔楼中每一块砖的精确高度,他就会开始犯错。他可能会说“把砖块放在这里”,却没意识到下面已经有一块砖了,或者可能会把它们堆得太高。

解决方案:防重力的“工头”

作者们意识到,在许多搭建任务中,积木的高度并非随意选择,而是由物理定律决定的。如果你在有重力的平坦地面上搭建,新积木必须放置在现有最高积木的顶部。高度是自动确定的。

因此,他们将工作分为两部分:

  1. 建筑师(LLM):这部分只被允许绘制二维平面图。它会说:“在位置 X 放一个红色方块,在位置 Z 放一个蓝色方块。”它被禁止谈论高度(Y 轴)。它只规划建筑的“占地面积”。
  2. 工头(确定性代码):这是一个简单、无需思考的计算机程序。它唯一的任务是查看平面图并说:“好的,你想在 X 和 Z 处放一个方块?好吧,重力规定它必须放在那里已有的任何东西之上。”它自动计算高度。

通过将“高度”决策从笨拙的建筑师手中夺走,交给无需思考的工头,他们消除了一个大类的错误。

“窥视孔”技巧

论文还提到了一种“窥视孔提示优化”。想象一下,建筑师容易陷入特定且可预测的白日梦。例如,如果你说“延伸末端”,建筑师可能会意外地搭建一座塔,而不是延伸地面。

研究人员创建了一个“抽查”系统。在建筑师绘制蓝图之前,一个快速扫描仪会检查指令。如果它发现已知会导致问题的短语(如“每个末端”),它就会在建筑师的耳边塞入一张微小而具体的便条:“嘿,当你看到‘每个末端’时,请记住向侧面延伸,而不是向上延伸。”这就像是为建筑师的已知弱点设置的安全网。

结果

当他们测试该系统时:

  • 旧方法:仅使用 LLM 完成所有工作(3D 规划),准确率约为 76% 到 90%。
  • 新方法:使用 2.5 维分解(建筑师 + 工头),准确率提升至94.6%
  • 意外发现:使用这种新方法的小型、低成本 AI 模型(GPT-4o-mini)实际上击败了未使用该方法的大型、高成本模型(GPT-4o)。

现实世界的可移植性

论文还表明,这种技巧不仅仅适用于某一台特定的计算机。他们在小型、强大的计算机芯片(NVIDIA Jetson Thor)上运行了同一系统,该芯片可以安装在机器人头部,其效果与巨型云端计算机一样好。

核心结论

主要观点很简单:不要要求语言模型去做它不擅长的数学运算。 如果任务的某一部分是由物理定律固定的(例如重力决定高度),就让一个简单的计算机程序来处理那部分。让 AI 只专注于计划中富有创造力和灵活性的部分。即使 AI 本身并不完美,这也能使整个系统更加可靠。

注:论文提到,剩余错误中约有 5% 来自另一个不同的“建筑师代理”,该代理负责回答澄清性问题,这是他们无法用此特定方法解决的独立局限性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →