← 最新论文
💻 computer science

Next-Scale Autoregressive Models for Text-to-Motion Generation

本文介绍了 MoScale,这是一种下一代自回归框架,它通过跨尺度与尺度内细化机制,从粗到细分辨率分层生成文本到动作的映射,实现了最先进的性能、高效的训练以及强大的零样本泛化能力。

原作者: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据一段文字描述来教机器人跳舞。如果你告诉机器人:“做两个开合跳,然后转身,捡起某样东西,再转回来”,标准的 AI 可能会把单个步骤做对,但搞错顺序或数量。它可能会做三个开合跳,或者忘记在最后转身。

本文介绍了一种名为MoScale的新型 AI 模型,它解决了这个问题。以下是通过简单类比对其工作原理的解释:

问题所在:“一步接一步”的陷阱

当前大多数用于动作生成的 AI 模型,工作方式就像一个逐字阅读书籍的人。它们仅根据紧挨着的前一个动作来预测下一个动作。

  • 类比:想象一下,你试图只盯着刚刚画下的那一小笔笔触,来绘制一幅宏大的风景画。你或许能画对那一小处的颜色,但却失去了整体大局。你可能会忘记山应该在左边,或者河流需要朝特定方向流淌。
  • 结果:机器人的动作在局部看起来是流畅的(膝盖弯曲正确),但整个故事却是错的(它没有完成你要求的两个开合跳)。

解决方案:“从建筑师到室内设计师”的方法

MoScale 改变了策略。它不再一次预测一个微小的动作,而是从**粗略(大局)精细(细节)**分层构建动作。

  1. 粗略尺度(建筑师):首先,模型扮演建筑师的角色,勾勒蓝图。它以低分辨率决定舞蹈的整个结构。它会说:“好的,整个序列是:跳、跳、转、捡、转。”它在担心手指如何移动之前,先锁定全局故事。
  2. 精细尺度(室内设计师):一旦蓝图确定,模型就会放大视角。它在那份粗略的草图上添加细节,比如跳跃的确切高度或转身的速度。它逐步细化动作,但绝不会改变建筑师已经决定的主要故事。

秘诀所在:两项“细化”技巧

作者添加了两项特殊功能,使这一过程更加完善,尤其是考虑到可用于训练的舞蹈数据量并不巨大。

1. “带着错误练习”技巧(跨尺度分层细化)

  • 问题:如果你只按照完美的指令练习,一旦犯错就会惊慌失措。
  • 类比:想象一个正在学开车的学生。如果教练允许他在完美、空旷的道路上驾驶,那么一旦遇到坑洼,他就会撞车。
  • MoScale 的改进:在训练期间,模型会故意收到“被破坏”或不完美的蓝图。它必须学会修正“建筑师”犯下的错误,并依然生成出色的舞蹈。这教会模型具备鲁棒性并从错误中恢复,确保即使早期步骤略有偏差,最终动作仍能忠实于文本。

2. “再看一眼”技巧(同尺度时间细化)

  • 问题:即使决定了大局,模型仍可能在某个具体细节上出错,比如手以错误的方向抽搐。
  • 类比:想象你在写一篇文章。你写完初稿后,再回头重读。你会发现拼写错误或笨拙的句子,并将其修正。
  • MoScale 的改进:在模型为特定层级做出预测后,它可以“回头看”自己刚刚写下的内容。它识别出自己不确定的部分并重新预测。这就像第二稿,在不破坏整体故事的前提下,打磨动作使其更流畅、更逼真。

为何这很重要

该论文声称,MoScale 是首个成功将“下一个词元”模型的速度与理解长篇复杂故事的能力相结合的模型。

  • 更好的叙事能力:它遵循“两个开合跳”或“转身、捡起、转身”等指令的能力,远胜于之前的模型。
  • 高效性:它的训练速度比流行的“扩散”模型更快(扩散模型就像试图通过慢慢消除噪声,将一块噪声转化为图像)。
  • 多功能性:由于它如此擅长理解结构,它还可以编辑现有舞蹈(例如将走改为跑),而不会破坏你不希望改变的部分。

简而言之,MoScale 阻止了 AI 在细节中迷失,迫使它先规划整个舞蹈,确保机器人真正执行你所要求的动作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →