In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics
该论文提出了上下文内模型预测生成(In-Context Model Predictive Generation, ICMPG)框架,该框架通过将大语言模型规划与推理时的物理反馈集成到一个类似于模型预测控制的闭环过程中,弥合了文本驱动运动合成中语义保真度与物理真实性之间的差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想通过输入一个简单的句子,比如“他一边笨拙地滑行,一边抛接球”,来教机器人跳舞。
目前的方法通常会陷入两种困境:
- “梦想家” (The Dreamer): 这些系统非常擅长理解你的语言并构思出极具创意的计划,但当它们尝试移动时,往往会违反物理定律。机器人可能会在空中漂浮、像在冰面上一样滑动,或者以一种不可能的方式扭曲双腿。
- “体操运动员” (The Gymnast): 这些系统是动作写实和遵循重力的专家,但它们很难理解复杂或新颖的指令。如果你要求一些不寻常的动作,它们就会感到困惑,或者只做出一些通用的动作。
本文介绍了一种名为 ICMPG(上下文模型预测生成)的新系统,它就像一位聪明的导演,结合了两者的优点。
核心理念:“导演与排练室”
将 ICMPG 系统想象成一部由两个主要角色协同工作的电影制作过程:
1. 编剧 (The LLM Planner)
这是一个强大的 AI 语言模型(类似于那些编写故事的模型)。它的任务是将你那杂乱、开放式词汇的句子(例如:“他一边笨拙地滑行,一边抛接球”)分解成一步步微小的、原子级的动作脚本。它本身并不驱动机器人移动,它只是编写计划。
2. 排练室 (The Physics Simulator)
这是一个机器人可以尝试执行脚本的虚拟世界。但转折在于:机器人并不只是盲目地执行脚本。
它是如何运作的:“尝试、测试并挑选”循环
ICMPG 并没有采用“编剧一次性写完整部电影并寄希望于成功”的方式,而是采用了模型预测 (Model Predictive) 的方法。这就像棋手下棋或舞者排练动作一样:
- 生成选项: 编剧(LLM)观察机器人目前已经做了什么,然后建议好几种不同的下一步动作(候选方案)。它可能会说:“好的,对于下一步,他可以向左跳、向右跳或旋转。”
- 排练: 系统将所有这些选项放入排练室(物理模拟器)中运行。
- 这个跳跃看起来符合物理规律吗?(机器人会摔倒吗?)
- 它符合故事描述吗?(这真的是在做月球漫步吗?)
- 评分: 系统根据两点为每个选项打分:
- 物理得分: 机器人是否保持在地面上?是否发生了滑动?
- 语义得分: 这个动作是否真的符合用户的要求?
- 选择: 系统挑选出唯一的最佳选项,该选项在真实感和对文本的准确度之间取得了平衡。
- 重复: 系统锁定这个最佳动作,将其加入历史记录,然后根据新的情况要求编剧生成下一组选项。
为什么这与众不同
大多数其他方法是**“开环” (Open-Loop)** 的。它们写好整个脚本后就结束了,并寄希望于结果。如果机器人摔倒了,它们无法修复,因为脚本已经完成了。
ICMPG 是**“闭环” (Closed-Loop)** 的。它就像一位导演,每隔几秒钟就会暂停拍摄,检查演员是否站在坚实的地面上;如果没有,他会说:“不,再试一次,”然后再进入下一个场景。它能在不针对每种新类型的舞蹈进行重新训练的情况下,实时不断地自我修正。
实验结果
作者在大型人类运动数据集上对该系统进行了测试。他们发现:
- 它能理解奇特的请求: 它可以处理其他系统会感到困惑的复杂、新颖的短语。
- 它不会破坏物理规律: 机器人不会漂浮或滑动;它们的动作非常自然。
- 它具有灵活性: 你以后可以把“编剧”更换为更智能的 AI,而系统只会变得更好,而不需要进行彻底的重构。
简而言之,ICMPG 是一个利用智能语言 AI 来编写计划,并利用物理引擎来不断核查计划的系统,从而确保最终的动作既忠于故事又符合物理规律。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。