← 最新论文
🤖 machine learning

Training and Benchmarking Code Generation for Physics-Inspired Animations

本文介绍了 SimuScene,这是一个用于训练和评估大语言模型生成物理启发式动画的可执行代码的综合数据集和基准测试,证明了即使是顶尖模型在处理该任务时也表现挣扎,但通过一种利用视觉奖励的新型强化学习流水线可以得到显著改善。

原作者: Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它能读一本故事书,并能瞬间写出让故事变成电影的计算机代码。你告诉它:“一个球滚下山坡并撞到了墙上”,你期望看到的是一个球滚下山坡并撞向墙壁。这就是**大语言模型(LLMs)**的梦想:让计算机能够理解人类语言并将其转化为行动。但这里有一个棘手的部分。仅仅因为机器人写出了代码,并不意味着它制作的电影真的看起来像那个故事。代码可能会运行,但球可能会像幽灵一样漂浮,或者向上坡滚动,或者变成一个正方形。这篇论文探讨了科学的一个特定领域,我们在这里追问:这些人工智能机器人是否不仅能写剧本,还能真正导演电影中的物理效果,使其感觉真实?这就像是要求一位厨师不仅要写出一份蛋糕的食谱,还要真正烤出一个吃起来像蛋糕而不是像砖头的东西。

这项研究背后的研究人员,由来自穆罕默德·本·扎耶德人工智能大学和中山大学的一个团队领导,决定让这些人工智能机器人接受终极测试。他们创建了一个名为 SimuScene 的新游戏。把它想象成一个巨大的、自动化的游乐场,拥有 52 种不同的物理主题,比如重力、光照、电力以及流体的流动方式。他们构建了一个系统,可以生成数千个独特的场景——比如“在光滑桌面上旋转的圆盘”或“通过透镜折射的光线”——然后要求人工智能编写 Python 代码来进行动画制作。但关键在于:人工智能不仅仅是因为写出了能运行的代码就能通过。代码必须产生一段视频,其内容实际上要符合所描述的物理特性。为了检查这一点,他们使用了一个特殊的“裁判”(视觉语言模型),该模型会观看生成的视频并回答问题,例如:“球弹跳了吗?”或者“光线折射的方向对吗?”如果视频未能通过这些问题的测试,人工智能也就失败了。

结果是一个现实的警示。即使是当今最聪明、最先进的人工智能模型也表现得非常吃力。当研究人员要求 10 个顶尖的人工智能模型生成这些动画时,表现最好的一个平均也仅能正确完成约 21.5% 的场景。这意味着在 100 次尝试中,人工智能大约只能成功创建 21 次与物理描述相符的视频。大多数情况下,代码虽然可以运行,但动画会显得很奇怪:物体可能会穿过墙壁,移动方向错误,或者完全忽略重力。事实证明,教人工智能写代码是一回事,但教它理解世界的运动规律以及如何将这些规律可视化,则是另一个难得多的谜题。

然而,这篇论文并不仅仅停留在说“这很难”。团队还尝试了一种巧妙的技巧来让人工智能变得更好。他们使用了一种叫做强化学习的方法,这就像是用零食训练狗一样。他们不再仅仅根据文本告诉人工智能“做得好”或“做得不好”,而是让人工智能生成一段视频,观看这段视频,并且只有当视频看起来确实正确时,才给它一个“奖励”(即零食)。他们使用了一个基于视觉的评判者来给出这些奖励。经过这种训练后,人工智能模型的表现有了显著提升。一个初始成功率为 0% 的较小模型在训练后达到了 11.1% 的通过率,而一个较大的模型则从 18.3% 跳升到了 34.4%。这表明,虽然人工智能目前还不是完美的物理引擎,但如果你向它们展示它们创作的实际视频,并让它们看到自己的错误,它们是可以学会进步的。

简而言之,这篇论文表明,尽管我们的人工智能朋友在编写代码方面表现出色,但在成为优秀的物理导演方面仍在学习阶段。它们可以写出剧本,但让电影看起来真实仍然是一个正在进行中的过程。该团队构建了一个包含超过 7,600 个物理场景的大型数据集来帮助训练它们,他们的实验证明,通过观察结果(视频)并从中学习,是教导这些模型的一种强大方式。这是一个充满希望的迹象,表明通过正确的训练,我们可能很快就能拥有能够将我们最狂野的物理描述转化为准确、生动的动态图像的人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →