✨ 要点🔬 技术摘要
想象一下,你正试图根据一段文字描述来教机器人跳舞。如果你告诉机器人:“做两个开合跳,然后转身,捡起某样东西,再转回来”,标准的 AI 可能会把单个步骤做对,但搞错顺序或数量。它可能会做三个开合跳,或者忘记在最后转身。
本文介绍了一种名为MoScale 的新型 AI 模型,它解决了这个问题。以下是通过简单类比对其工作原理的解释:
问题所在:“一步接一步”的陷阱
当前大多数用于动作生成的 AI 模型,工作方式就像一个逐字阅读书籍的人。它们仅根据紧挨着的前一个动作来预测下一个动作。
类比 :想象一下,你试图只盯着刚刚画下的那一小笔笔触,来绘制一幅宏大的风景画。你或许能画对那一小处的颜色,但却失去了整体大局。你可能会忘记山应该在左边,或者河流需要朝特定方向流淌。
结果 :机器人的动作在局部看起来是流畅的(膝盖弯曲正确),但整个故事却是错的(它没有完成你要求的两个开合跳)。
解决方案:“从建筑师到室内设计师”的方法
MoScale 改变了策略。它不再一次预测一个微小的动作,而是从**粗略(大局)到 精细(细节)**分层构建动作。
粗略尺度(建筑师) :首先,模型扮演建筑师的角色,勾勒蓝图。它以低分辨率决定舞蹈的整个 结构。它会说:“好的,整个序列是:跳、跳、转、捡、转。”它在担心手指如何移动之前,先锁定全局故事。
精细尺度(室内设计师) :一旦蓝图确定,模型就会放大视角。它在那份粗略的草图上添加细节,比如跳跃的确切高度或转身的速度。它逐步细化动作,但绝不会改变建筑师已经决定的主要故事。
秘诀所在:两项“细化”技巧
作者添加了两项特殊功能,使这一过程更加完善,尤其是考虑到可用于训练的舞蹈数据量并不巨大。
1. “带着错误练习”技巧(跨尺度分层细化)
问题 :如果你只按照完美的指令练习,一旦犯错就会惊慌失措。
类比 :想象一个正在学开车的学生。如果教练只 允许他在完美、空旷的道路上驾驶,那么一旦遇到坑洼,他就会撞车。
MoScale 的改进 :在训练期间,模型会故意收到“被破坏”或不完美的蓝图。它必须学会修正“建筑师”犯下的错误,并依然生成出色的舞蹈。这教会模型具备鲁棒性并从错误中恢复,确保即使早期步骤略有偏差,最终动作仍能忠实于文本。
2. “再看一眼”技巧(同尺度时间细化)
问题 :即使决定了大局,模型仍可能在某个具体细节上出错,比如手以错误的方向抽搐。
类比 :想象你在写一篇文章。你写完初稿后,再回头重读。你会发现拼写错误或笨拙的句子,并将其修正。
MoScale 的改进 :在模型为特定层级做出预测后,它可以“回头看”自己刚刚写下的内容。它识别出自己不确定的部分并重新预测。这就像第二稿,在不破坏整体故事的前提下,打磨动作使其更流畅、更逼真。
为何这很重要
该论文声称,MoScale 是首个成功将“下一个词元”模型的速度与理解长篇复杂故事的能力相结合的模型。
更好的叙事能力 :它遵循“两个开合跳”或“转身、捡起、转身”等指令的能力,远胜于之前的模型。
高效性 :它的训练速度比流行的“扩散”模型更快(扩散模型就像试图通过慢慢消除噪声,将一块噪声转化为图像)。
多功能性 :由于它如此擅长理解结构,它还可以编辑现有舞蹈(例如将走改为跑),而不会破坏你不希望改变的部分。
简而言之,MoScale 阻止了 AI 在细节中迷失,迫使它先规划整个舞蹈,确保机器人真正执行你所要求的动作。
技术摘要:MoScale——用于文本到动作生成的下一代尺度自回归模型
1. 问题陈述
文本到动作生成旨在合成能够忠实反映文本描述的人类动作。尽管近期模型(扩散模型、掩码 Transformer 和下一词元自回归模型)能够生成逼真的局部动态,但它们难以保持全局语义结构 。具体而言,现有方法往往无法与涉及重复次数(例如“做两个开合跳”)或序列动作模式(例如“转身、捡起东西、再转身”)的复杂文本指令保持一致。
作者指出了导致这一局限性的两个主要原因:
扩散模型和掩码模型 :这些模型生成全分辨率序列时缺乏因果顺序,依赖双向细化。在单一、无向的预测步骤中推断全局语义 inherently 困难,随后的细化主要强制局部连贯性,而非改变初始草稿中建立的全局结构。
下一词元自回归(AR)模型 :虽然在语言建模中表现成功,但下一词元 AR 在动作生成中表现不佳。人类动作表现出高度可预测的短期动态,使得 AR 模型能够通过利用短期可预测性来最小化损失,而非学习全局时间结构。此外,动作词元化中的时间卷积编码器放大了局部相关性,使得模型进行长程推理变得不那么必要,从而导致生成的动作局部连贯但全局错位。
2. 方法论:MoScale
本文提出了MoScale ,这是一个下一代尺度自回归 框架,用从粗到细的因果层次结构取代了标准的下一词元预测。
2.1 分层动作表示
MoScale 利用残差 VQ-VAE 将动作序列编码为 K K K 个尺度的离散词元。
粗尺度 :编码全局结构。
细尺度 :表示先前层级未捕获的残差细节。
词元化 :给定输入动作 m m m ,编码器生成潜在特征。这些特征被下采样到不同的时间分辨率(L 1 , … , L K L_1, \dots, L_K L 1 , … , L K )。在每个尺度 k k k 上,目标特征是原始特征减去先前尺度的累积重建后的残差。该残差使用共享码本进行量化,以生成离散词元 z k z_k z k 。
2.2 下一代尺度自回归生成
模型不是逐个预测词元,而是针对特定尺度预测一整组词元 z k z_k z k ,其条件包括:
先前生成的较粗尺度(z 1 , … , z k − 1 z_1, \dots, z_{k-1} z 1 , … , z k − 1 )。
文本嵌入(源自预训练的 T5 编码器)。
该架构采用具有尺度级因果掩码 的因果 Transformer 进行自注意力,以防止信息从较细尺度泄露到较粗尺度,确保严格的层次因果性。交叉注意力关注原始文本嵌入,以保持一致的语义引导。
2.3 细化策略
为解决数据稀缺和误差传播问题,MoScale 引入了两种细化机制:
跨尺度分层细化 :
问题 :标准的下一代尺度 AR 使用教师强制(teacher forcing)和干净的真实输入,导致模型在推理期间无法学习如何从不完美的粗尺度预测中恢复。
解决方案 :在训练期间,模型通过随机替换部分词元为随机码本条目,对较粗尺度(k − 1 k-1 k − 1 )的词元引入扰动。尺度 k k k 的模型随后被训练基于该受损 输入来预测残差。这迫使模型学习自适应细化并纠正从早期阶段传播的误差,从而减少暴露偏差。
尺度内时间细化 :
问题 :与语言语料库相比,文本 - 动作数据集规模较小。
解决方案 :在每个尺度内,模型采用选择性掩码与重预测 策略。利用尺度内可用的双向注意力,模型识别低置信度词元,将其掩码,并迭代地重新预测它们。这模仿了扩散风格的迭代细化,但在因果 AR 框架内运行,在不破坏全局从粗到细结构的情况下,提高了局部时间连贯性和保真度。
3. 主要贡献
下一代尺度 AR 框架 :引入了一种用于动作生成的分层因果结构,克服了下一词元 AR 的“短期捷径”局限以及扩散/掩码模型的全局对齐问题。
细化机制 :提出了跨尺度分层细化 以处理误差传播和数据有限问题,以及尺度内时间细化 以利用尺度内的双向上下文增强局部连贯性。
最先进(SOTA)性能 :证明了 MoScale 在标准基准测试中实现了 SOTA 性能,同时保持了高训练效率。
零样本泛化 :展示了该框架无需针对特定任务进行微调即可泛化到多样化任务(修复、外绘、编辑、连续生成)的能力。
4. 实验结果
该模型在HumanML3D 和KIT-ML 数据集上进行了评估。
定量性能 :MoScale 优于现有的下一词元 AR、扩散和掩码 Transformer 基线。
在 HumanML3D 上,它取得了最佳的R-Precision (Top-1: 0.540)和MM-Dist (2.830),以及具有竞争力的FID (0.046)。
它能随模型规模(从 4 到 18 个尺度/步骤)有效扩展。
定性性能 :可视化显示,MoScale 成功捕捉了细粒度语义(例如特定的重复次数和复杂序列),而基线模型在这些方面失败。
复杂度分析 :MoScale 在高复杂度文本描述上显示出相对于基线最大的相对增益,验证了分层设计对复杂语义指令的有效性。
效率 :MoScale 的训练速度快于扩散模型,与掩码 Transformer 相当。推理效率高(完整模型为 0.28 秒,最小配置为 0.08 秒),显著快于基于扩散的方法(例如 MotionDiffuse 为 7.12 秒)。
用户研究 :用户更倾向于选择 MoScale 而非基线模型,无论是在文本对齐(71.5% 的投票)还是动作质量(73.3% 的投票)方面。在零样本编辑任务中,它在动作质量、文本对齐和一致性方面获得了最高的偏好评分。
5. 意义与主张
本文声称,分层因果性 是改善文本对齐的主要驱动力。通过在粗尺度上建立全局语义支架并逐步细化,MoScale 避免了下一词元 AR 的“短期捷径”和双向细化模型的“全局结构不稳定性”。
作者强调:
分层预测路径 是捕捉详细文本线索的主导因素,其表现优于单独的双向迭代细化。
时间细化 主要有助于局部平滑度和一致性,但在全局文本对齐中起次要作用。
该框架在数据有限 的情况下具有鲁棒性,利用跨尺度扰动来模拟多样化的中间状态。
MoScale 通过其掩码与重预测策略,为条件任务(文本到动作)和无条件任务(编辑、修复)提供了统一的方法,有效地保留了未编辑区域。
这项工作表明,将扩散风格的优点(迭代细化、双向上下文)整合到因果分层自回归框架中,为文本到动作生成提供了训练效率、全局语义对齐和局部动作质量之间的更优平衡。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。