← 最新论文
🤖 machine learning

Clarify Before You Draw: Proactive Agents for Robust Text-to-CAD Generation

本文介绍了 ProCAD,这是一个主动式智能体框架,它通过在代码合成前进行针对性的澄清来解决模糊或不一致的文本提示,在生成鲁棒且有效的 CadQuery 程序方面显著优于现有模型。

原作者: Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位想要打造一件定制家具的建筑师,但你不是亲自绘制蓝图,而是向一个非常聪明、但有点过于死板的机器人建造师进行描述。

问题所在:“建造中的猜谜游戏”
过去,如果你告诉机器人,“给我做一个圆顶四条腿的桌子”,它会立即尝试开始建造。但问题在于,你并没有说明这张桌子有多大、桌腿有多粗,或者桌面应该是木头还是金属。

因为机器人急于表现,它会猜测缺失的细节。有时它猜对了,但通常它会造出一个摇摇晃坠、极小或根本无法实现的桌子。如果你的指令稍有矛盾(例如,“一个既是正方形又是完美的圆形的顶面”),机器人就会陷入混乱,或者造出一些散架的东西。

解决方案:“澄清代理”(ProCAD)
作者 Bo Yuan 及其团队意识到,解决这个问题最好的方法不是让机器人变得更擅长猜测,而是让它先提问

他们构建了一个名为 ProCAD 的系统,其运作方式就像一个两人协作的施工队:

  1. 侦探(澄清代理/Clarifying Agent): 在机器人开始建造之前,这个代理充当一名细心的项目经理。它会阅读你的请求并说:“等等。你说‘圆顶’,但你没说尺寸。是 2 英尺还是 20 英尺?另外,你说‘正方形’又说‘圆形’——你到底是指哪一个?”

    • 它只在确实必要时才提问,因此不会用无数个问题来烦扰你。
    • 它会等待你的回答,以创建一个完美、完整的蓝图
  2. 建造者(编码代理/Coding Agent): 一旦侦探拥有了清晰、无矛盾的蓝图,它就会将蓝图交给建造者。这个代理是一个专家,它完全知道如何将这些清晰的指令转化为实际构建 3D 模型的计算机代码(CadQuery)。

他们是如何训练这个团队的
为了教会这个团队如何协作,研究人员并没有仅仅给它们随机的指令。他们创建了一个特殊的训练库:

  • 针对建造者: 他们使用了 1,600 个完美的示例,其中指令清晰,生成的 3D 模型也完美无瑕。这教会了建造者如何在指令良好的情况下编写完美的代码。
  • 针对侦探: 他们创建了一个“模拟游戏”。他们拿走完美的指令,并故意搞乱它们(删除尺寸、添加矛盾)以创建“损坏的”请求。然后,他们教会了侦探如何识别这些错误并提出正确的问题来修复它们,同时保持对话简短精炼。

结果:为什么这很重要
当他们将 ProCAD 与其他顶尖 AI 模型(包括像 Claude Sonnet 4.5 这样昂贵的闭源模型)进行对比测试时,结果令人印象深刻:

  • 更少的错误: “无效率”(机器人崩溃或制造垃圾的频率)从接近 5% 下降到了不到 1%。
  • 更高的准确度: 最终的 3D 模型与用户实际需求的契合度更高。“倒角距离”(衡量形状与目标接近程度的一种数学方法)提升了近 80%
  • 更低的挫败感: 该系统比其他模型提问更少,完成工作更快。

概括而言
与其强迫 AI 去猜测你的心思并听天由命,ProCAD 更像是一个乐于助人的真人助手,在开始工作前会反复核实细节。通过“在绘图前先澄清”,它确保了最终的 3D 设计完全符合你的想象,而无需经历那些破碎模型的试错过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →