← 最新论文
💻 computer science

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

本文介绍了 MRBench,这是一个具有多样性、平衡性和多粒度数据的全面人类运动-文本检索基准,旨在解决现有数据集的局限性,并提出了一种轻量级的粒度感知模型,该模型显著提升了跨领域泛化能力以及不同描述层级的检索性能。

原作者: Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人理解人类的动作,不仅是通过观察,还要通过聆听我们对动作的描述。这就是人类动作-文本检索的世界——在这个领域,计算机试图将一段人跳舞或走路的视频与描述该动作的具体词汇进行匹配。把它想象成一位拥有超能力的图书管理员,她不仅看书名,还能理解书中的故事,从而精准匹配像“给我看那个由于鞋带绊倒的人”这样的请求。长期以来,科学家们一直在构建这些运动视频及其描述的“图书馆”,以此来训练他们的机器人。然而,这里有一个陷ary:如果这个图书馆里只包含人们在白色的房间里直行走的视频,且所有的描述都只是“人行走”,那么机器人学到的将是一个非常狭隘、枯燥的世界版本。它可能非常擅长寻找那一种特定的行走,但如果你让它找一个在公园里做后空翻的人,或者在厨房里踉跄跌倒的人,它就会完全不知所措。

这正是来自上海交通大学和北京中关村科学院的一个研究团队决定解决的问题。他们意识到,旧有的运动数据库过于简单、过于重复,并且无法反映人类实际运动时那种杂乱、多样化的现实情况。因此,他们构建了一个全新的、庞大的库,名为 MRBench。他们的库中不再只有“行走”,而是包含了 3,390 种不同的动作,范围从室内舞蹈动作到从视频甚至计算机生成动画中捕捉到的各种真实的现实世界动作。他们涵盖了 118 个不同的运动类别,确保没有单一类型的运动会主导整个收藏。但他们并没有止步于视频;他们还重写了描述。他们为每一个动作创建了三个层级的细节:一个简短、有力的总结(如“人摔倒”),一个标准描述(如“人向后摔倒在地板上”),以及一个超级详细、细粒度的叙述(如“人开始站立,向后倾斜,坍塌,并静止不动地着地”)。这使得他们能够测试计算机是否能理解一个简单的指令与一个复杂的、详细的故事。

当他们用这个新库进行测试时,他们发现旧的、流行的计算机模型面临着一场残酷的觉醒。这些模型在旧的、简单的库上测试时显得很聪明,但在面对 MRBench 的多样性时却表现得非常挣扎。它们就像一个背下了特定练习题答案的学生,但在问题换了问法或询问新话题时却不及格了。研究人员发现,这些模型对文本的详细程度非常敏感;当描述词与它们习惯的内容不完全一致时,它们经常会感到困惑。为了解决这个问题,该团队设计了一种新的轻量级模型,它扮演着一个灵活翻译官的角色。它保留了一个理解标准描述的坚实基础,同时增加了特殊的“适配器”,这些适配器可以快速调整,以理解简短的摘要或冗长的详细故事,而不会迷失方向。通过测试这种新方法,他们证明了让计算机更好地理解人类运动和语言的全谱系——从一个快速的“跳跃”到一个体操常规动作的详细解说——是完全可能的,而且不会忘记如何处理基础内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →