← 最新论文
💻 computer science

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

FineMoLA 是一个弱监督框架,它通过分割长篇描述并解决最优传输问题,在无需显式人工标注的情况下,从片段级注释中实现细粒度的动作-文本对齐,从而推断出伪帧级对应关系。

原作者: Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过给机器人读一个故事来教它跳舞。你有一个舞者的视频,以及一段描述了每一次扭转、转身和跳跃的长段落。但棘手的地方在于,这个故事是以一大块文本的形式呈现的,而视频仅仅是一连串的帧。如果你只是告诉机器人,“这整个故事对应这段整个视频”,机器人会感到困惑。它不知道什么时候该旋转,什么时候该跳跃。这就像是试图将一整首歌与一部电影进行匹配,却不知道哪个场景对应哪个副歌。这就是“文本生成动作”(text-to-motion)领域的科学家们试图解决的问题。他们希望计算机不仅能理解故事的整体氛围,还能理解文本中某个特定词汇与视频中特定帧之间的精确对应关系。这对于让电子游戏或电影中的虚拟角色动作自然,而不是看起来像是在盲目猜测下一步该做什么,至关重要。

于是,FineMoLA 登场了,这是一种像超级聪明侦探一样去破解这个时间匹配谜题的新方法。研究人员注意到,虽然我们拥有庞大的舞蹈视频库及其长篇描述,但没有人手动标注出哪个词对应哪一秒的动作。让人们去做这件事需要耗费极长时间。所以,FineMoLA 并没有寻求帮助,而是通过自我学习来解决问题。它获取长篇故事,将其分解为小的动作短语(例如“向左倾斜”或“轻敲门”),然后使用一种叫做“最优传输”(Optimal Transport)的数学技巧,来找出将这些短语与视频帧进行匹配的最佳方式。你可以把它想象成一场音乐椅游戏,椅子是视频帧,而玩家是单词。该算法不仅仅是在猜测;它在计算将两者配对的最有效方式,甚至允许一个动作持续数秒,或者某一帧可能不匹配任何特定的单词。

论文发现,这种自学方法的效果出奇地好。通过将匹配问题视为从文本到视频移动“质量”的过程,该系统学会了在不需要人类在视频上画框的情况下实现两者的对齐。当他们在名为 SnapMoGen 的数据集(包含高质量动作捕捉数据)上进行测试时,FineMoLA 在寻找正确连接方面的表现远优于以往那些仅靠猜测或使用大型 AI 模型观察视频的方法。结果表明,计算机现在可以理解“焦虑地倾斜”是与“环顾四周”同时发生的,而不是将整个句子视为一个模糊的整体。作者指出,这可能会为未来对数字角色的精确控制带来可能,让创作者只需输入一个故事,就能生成复杂的、多步骤的舞蹈,而无需进行繁琐的人工标注工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →