← 最新论文
🤖 AI

Large Language Models and their Awareness of Mechanics and Spatial Geometry

本文介绍了 MecEng,这是一个全自动基准测试,通过测试 34 个大语言模型根据文本描述生成可用于仿真的多体系统模型的能力,来评估其机械工程意识,研究结果表明,尽管目前的模型在刚体任务上表现出快速进步和高成功率,但在处理复杂的柔性多体系统方面仍然存在困难。

原作者: Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:机器不再仅仅是由工程师利用蓝图和扳手制造,而是由能够阅读句子并理解物理世界运作方式的计算机进行设计。几十年来,计算机在处理语言、翻译文本或编写简单计算机代码方面表现出色。然而,一个新的前沿领域已经出现:人工智能系统能否真正理解物理定律?具体来说,它们能否理解力学——即研究固体物体如何运动、弯曲以及相互作用的学科——以及建造这些物体所需的复杂几何结构?这正是因斯布鲁克大学和奥格斯堡大学的研究人员试图回答的问题。他们想知道,现代人工智能是否可以根据一段关于机器(如起重机或机械臂)的文字描述,将其转化为一个遵循与现实世界物体相同的运动和力学规则的数字化仿真模型。

为了验证这一点,研究团队创建了一个名为 MecEng 的严苛测试,这是一个旨在挑战人工智能处理机械工程任务能力的完全自动化基准测试。研究人员向大语言模型(即许多现代聊天机器人背后的强大人工智能系统)输入了一系列从简单设置到复杂机械的文本描述。这些描述包含了关于质量、尺寸、关节以及不同部件应如何连接的细节。人工智能的任务是编写构建该机器数字模型的特定计算机代码。难点在于,模型必须是完美的。仅仅生成一个粗略的草图或具有视觉吸引力的图像是不够的;它必须生成一个精确的、数学上准确的仿真模型,该模型能够正常运行而不崩溃,并产生正确的物理行为。随后,研究人员将人工智能的工作成果与专家构建的“地面真值”(ground truth)模型进行了对比,检查了从零件形状到其随时间运动方式的一切细节。

结果揭示了一个进步神速但局限性依然存在的图景。当任务涉及简单的刚性机器时——即像摆动的钟摆或连接的连杆那样不会弯曲或拉伸的物体——最优秀的 AI 模型表现得非常出色。最强的商业模型 Claude-Opus-4.8 达到了 91.4% 的成功率,而最好的开源权重模型 qwen3.6:27b 则达到了 82.1%。这表明这些系统已经对基础机械概念产生了强烈的直觉。它们可以正确识别需要哪些部件、如何连接它们,以及如何分配重量和刚度等物理属性。

然而,当研究人员引入柔性概念时,难度急剧上升。在现实世界中,许多机器部件会在压力下发生弯曲、扭转和变形,例如风力涡轮机叶片或柔性机械臂。为了模拟这些部件,人工智能不仅要描述形状,还要生成详细的三维网格——即定义物体体积的微小三角形组成的数字网格——并计算该形状如何振动和运动。在此环节,性能显著下降。虽然顶尖的商业模型大约有 82% 的概率能创建正确的部件,但将这些柔性部件组装成一个完整的、可运行的机器仿真模型的成功率降至约 65%。开源权重模型的表现则更为挣扎,在处理最复杂的组装任务时,该类模型的平均成功率接近 25%,尽管像 gemma4:26b 这样的个体模型表现明显更差,仅为 5%。

研究精准地指出了人工智能容易出错的地方。这通常不是因为缺乏对宏观概念的理解;模型通常知道一台机器应该长什么样。相反,错误往往出现在细微之处。AI 可能会得到正确的部件大致形状,但遗漏了一个特定的倒角,或者分配了错误的材料密度,导致重量计算错误。在某些情况下,AI 生成的模型看起来很正确,但包含了一个细微的几何误差,导致仿真崩溃或产生不符合物理规律的结果。研究人员发现,这些错误并非随机产生的;它们通常源于 AI 未能遵循关于部件排序或定义连接方式的具体指令。

有趣的是,研究人员发现,提示词的方式对结果的影响不如模型自身能力那么重要。改变指令的措辞或要求 AI “一步步思考”问题在某些情况下确实有所帮助,但也显著增加了获取答案所需的时间和计算能力。对于最复杂的任务,这种“思考”过程有时会让 AI 变得更慢,却无法保证获得更好的结果。研究还显示了一个明显的趋势:发布于 2025 年和 2026 年的新型模型表现持续优于旧模型,这表明随着这些系统接受更多数据的训练,理解机械工程的能力正在迅速提升。

尽管取得了令人印象深刻的进展,研究人员得出结论:目前的生成式人工智能尚未准备好取代人类工程师进行复杂的工程设计工作。虽然这些系统可以高可靠性地处理简单机器,但在面对复杂几何结构和柔性系统的物理特性时,仍然容易出现难以察觉的细微错误。这项研究强调,尽管人工智能已经学会了模仿工程语言,但尚未完全内化支配现实世界的物理定律。未来的路径在于改进这些模型以减少那些微小但关键的错误,使它们从合格的助手转变为能够可靠参与设计塑造我们未来之机器的合作伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →