Robust Motion Generation using Part-level Reliable Data from Videos
本文针对视频运动数据中的遮挡和画面外捕捉挑战,提出了一种鲁棒的部件感知掩码自回归模型,该模型利用仅有的可靠部件级信息来生成高质量的人体运动,并随之引入了一个名为 K700-M 的新型大规模基准测试集。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,尝试教计算机仅通过阅读一句话就能移动数字人类。你可能会输入“那个人正在跳舞”,并期望屏幕上展现出流畅、真实的表演。这个被称为“文本生成动作”(text-to-motion generation)的领域已经取得了显著进展,但它遇到了瓶颈。目前最好的结果来自于利用特殊的高质量真人动作录像来训练计算机,这些录像是在受控的工作室中使用昂贵的传感器捕捉而成的。虽然这些录像非常完美,但它们很稀缺、多样性有限,并且往往缺失了现实世界中人们运动时那种杂乱且复杂的方式。为了突破这一障碍,研究人员转向了互联网,希望从网上海量的普通视频中学习。这个想法很简单:如果计算机能从互联网庞大的图书馆中学习,它就能理解更广泛的行为范围。但问题在于,当计算机试图弄清楚一段普通视频中人的运动方式时,它往往无法看到全身。一个人的身体可能被树木遮挡,可能被摄像机画面的边缘切断,或者被另一个人挡住。在这些时刻,计算机必须猜测缺失的肢体在哪里。
这种猜测造成了一个根本性的学习问题。如果计算机看到一段视频,其中只有上半身可见,并且被迫从一个包含不可见腿部的全身猜测中进行学习,它可能会学到错误的东西。它可能会开始认为那些不可见的腿部是真实的证据,而非仅仅是一个猜测。长期以来,研究人员面临着一个艰难的选择:要么丢弃每一个不完美的视频片段,从而损失大部分数据;要么保留所有的片段,并寄希望于计算机能够忽略那些错误的猜测。这两种方法都有严重的缺陷。丢弃片段意味着失去了关于特定动作(例如人在坐着时如何移动手臂)的有价值信息。保留所有片段则意味着在用错误的信息教导计算机。一组研究人员现在发现了一种通过改变计算机观察数据的方式来解决这个问题的方法。他们不再将整个视频片段视为“好”或“坏”,而是教导计算机进行“分部观察”。
研究人员开发了一种像严谨编辑一样的新系统。当该系统分析视频时,它首先检查身体的哪些部分是实际可见的,哪些部分是隐藏的。如果一个人的腿被桌子挡住了,系统知道应该信任手臂和躯干的运动,但要忽略计算机对腿部的猜测。它将可见的部分视为确凿的事实,而将隐藏的部分视为稍后待填补的空白。这种方法使得系统能够从数千个此前被认为过于杂乱而无法使用的视频中学习。通过仅关注相机实际看到的身体部位,该系统建立起对运动可靠的理解,而不会被自己的猜测所误导。这就像是通过研究翅膀来识别一只鸟(即使尾巴被遮住了),而不是试图通过背诵一张包含虚构尾巴的完整鸟类图画来识别它。
为了测试这个想法,团队从互联网中创建了一个庞大的新数据集,包含近二十万对视频片段和文本描述。他们分析了这些片段,发现超过四分之三的帧中,至少有一个身体部位不是完全可见的。这证实了信息缺失的问题并非偶然,而是网络视频中的常态。利用这个数据集,他们训练了他们的新系统,并将其与旧方法进行了对比——旧方法要么丢弃杂乱的片段,要么在不进行过滤的情况下尝试学习所有片段。结果显而易见。这个关注可见部分的系统,比那些丢弃杂乱片段或试图从所有片段中学习的旧方法,产生了更准确、更真实的动作。它生成的动作不仅更符合文本描述,而且更加流畅自然。
研究表明,保留杂乱的片段并教导计算机忽略不可见的部分,远比丢弃这些片段效果更好。当研究人员在包含二十万个片段的大型集合上测试其系统时,该系统显著优于现有的最佳方法。那些保留所有数据的旧方法由于试图从不可见部分中学习而犯了许多错误,而丢弃坏数据的方法则丢失了太多的多样性。新系统在保持大规模数据集多样性的同时,避免了错误。它学到了一个人在坐着打鼓时,腿部可能会被遮挡,但其手臂运动仍然是真实且有用的学习素材。通过专注于可靠的部分,系统可以拼凑出完整的运动画面,而不会被缺失的部分所误导。
这项工作表明了一种利用不完美数据来教导计算机了解物理世界的全新方式。它证明了我们不需要完美的、录影棚级别的录像来教机器如何运动。相反,我们可以使用来自互联网的海量、杂乱的视频,只要我们教导机器学会聪明地对待它所信任的信息。系统不需要看到全身来学习人的运动方式;它只需要看到足够的身体部分来理解动作。这种方法为未来训练规模更大、能力更强的系统打开了大门,使它们能够理解比以往任何时候都更广泛的人类行为。研究人员发现,通过尊重摄像机所能看到的极限,计算机可以学到更多,而非更少。这种从“要求完美数据”到“从部分证据中学习”的策略转变,标志着在教导机器理解人类运动方面迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。