← 最新论文
💻 computer science

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

本文介绍了 3DCodeBench,这是一个综合性的基准测试与排名平台,旨在评估视觉语言模型智能体根据文本和图像提示生成程序化 3D 模型的能力,研究揭示了虽然测试时扩展(test-time scaling)可以提升性能,但当前模型在 API 不匹配和几何连贯性方面仍存在困难,从而凸显了对更好编码数据和执行环境的需求。

原作者: Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想建造一件复杂的家具,比如一把螃蟹形状的椅子,或者一棵漂浮的树。在过去,你需要雇佣一位精通木工的师傅,他知道如何精准地切割每一块木头并将其完美组装。今天,我们正试图教会 AI 成为那位木匠,只不过它不是使用锯子和锤子,而是通过在名为 Blender 的 3D 软件中编写计算机代码来构建物体。

这篇题为 3DCodeBench 的论文,本质上是为这些“AI 木匠”准备的一场巨大的“驾照考试”。以下是他们所做的工作以及他们的发现,我将使用简单的类比来进行说明。

1. 问题所在:AI 会说话,但它会建造吗?

我们拥有擅长写故事或回答问题的 AI 模型,也有能够生成静态 3D 图片的 AI。但现在存在一个缺口:程序化 3D 建模(Procedural 3D modeling)。这意味着 AI 需要编写一段脚本(一套指令)来告诉计算机:“从一个立方体开始,在这里挖个洞,在那里加一个鳍,然后让它看起来像一只螃蟹。”

问题在于编写这种代码非常困难。如果 AI 在代码中犯了一个微小的错误,计算机就会崩溃,或者生成的结果是一个漂浮着的、不连贯的形状堆砌,看起来不像一个真实的物体。

2. 解决方案:一条新的测试赛道 (3DCodeBench)

研究人员建立了一个庞大的测试场,名为 3DCodeBench。你可以把它想象成一个拥有 212 个不同“障碍赛道”(比如建造一条鱼、一个水槽或一片枫叶)的驾驶学校。

  • 数据集: 他们并没有随机捏造形状。他们从海量的现有完美 3D 模型库中提取数据,并对其进行逆向工程,从而创建出“正确的”代码。这为他们提供了 2.6 万对“指令 + 正确代码 + 最终物体”。
  • 测试: 他们要求 12 个顶尖的 AI 模型观察一个提示词(例如“做一个螃蟹”)并编写构建它的代码。
  • 竞技场 (3DCodeArena): 由于计算机无法判断一个 3D 螃蟹看起来是“酷”还是“奇怪”,他们建立了一个公开投票竞技场。人类会同时观察两个 AI 生成的螃蟹,并投票选出哪一个看起来更好。这创造了一个就像国际象棋或电子游戏一样的排行榜(Elo 等级分)。

3. 他们的发现:AI 正在进步,但依然笨拙

发现 1:“语法”与“结构”
AI 在编写能正常运行而不崩溃的代码方面表现得惊人地好。这就像一个学生能在纸面上写出一份完美的食谱。然而,最终做出的菜肴(3D 物体)往往会散架。

  • 问题所在: AI 经常创造出一些悬浮在半空中或与主体脱节的部分。它理解代码的“词汇”,但在 3D 物体如何实际组合在一起的“物理逻辑”方面却很吃力。

发现 2:“深度思考”有帮助(但并非总是如此)
研究人员测试了如果告诉 AI 在回答之前“多思考一会儿”(给它更多规划时间)会发生什么。

  • 结果: 对于较小、较轻量级的 AI 模型,给它们更多的“思考时间”就像是给学生一台计算器;这有助于它们修复简单的错误并编写出可运行的代码。
  • 局限性: 对于那些最大、最聪明的模型,它们在基础方面已经做得足够好了,额外的思考时间对它们帮助不大。它们只需要被告知如果失败了就“再试一次”。

发现 3:“重试按钮”是神奇的魔法
这是最重要的发现。当 AI 无法构建出物体时,研究人员让它查看错误信息(例如“语法错误”或“崩溃”),然后尝试再次运行。

  • 结果: 这种简单的“再试一次”循环将 50% 的成功率提升到了 97%。这就像一个学生数学考试不及格,看了看答案解析,看清了哪里错了,然后立即通过了重测。AI 不需要变得更聪明,它只需要一个修正特定错误的机会。

发现 4:人类 vs. 机器
他们问道:“AI 能判断另一个 AI 的 3D 模型有多好吗?”

  • 结果: 如果 AI 评委观察的是最终的 3D 图片,它与人类投票的一致性大约能达到 75%。
  • 关键点: 如果 AI 评委只观察代码(而不看结果),它的表现会大打折扣。这证明了要评判 3D 建模,你必须看到最终的产品,而不仅仅是阅读指令。

4. 核心结论

论文总结道,虽然 AI 在编写构建 3D 物体的代码方面已经变得非常出色,但在让这些物体看起来具有物理真实感和连贯性方面,仍然在物理逻辑上挣扎。

然而,最大的突破并不是一种新的 AI 模型,而是过程。通过让 AI 运行其代码、查看哪里出错并进行修复(一个“多轮对话”的过程),即使使用目前的模型,我们也能获得近乎完美的成果。

简而言之: 我们建立了一个健身房(3DCodeBench)来训练 AI 木匠。我们发现它们非常擅长遵循指令,但需要一位教练来指出它们的错误,以便它们修复那些悬浮、破碎的部分。一旦获得第二次机会,它们几乎可以建造任何东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →