← 最新论文
🤖 machine learning

Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

Human-JEPA 是一种以人为中心的视觉模型,通过锚定预测进行视频训练,在实现最先进的静态感知和未来预测的同时,其参数量显著少于现有的专家模型,克服了以往在运动理解和模型崩溃方面的局限性。

原作者: Hui Wei, Licai Sun, Guoying Zhao

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Hui Wei, Licai Sun, Guoying Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的视觉是一种双引擎机制。它不仅仅是在记录正在发生的事情,还在不断地模拟接下来会发生什么。当你看着一个人伸手去拿杯子时,你的大脑会同时识别出这个人,追踪其姿态,并在其手到达之前,精准地预测手将落下的位置。几十年来,人工智能一直难以复制这方程的后半部分。虽然机器在分析单张照片方面已经变得极其出色——能够识别人的面部、衣着或姿势——但它们在很大程度上对时间的流动保持着“盲目”。它们可以非常详细地描述一张静态图像,却无法预判视频中的未来运动。这一差距使得人类理解中的很大一部分内容仍处于计算机无法触及的领域,限制了它们以自然或安全的方式与世界进行交互的能力。

一项新研究介绍了一个名为 Human-JEPA 的系统,旨在弥合这一鸿沟。研究人员构建了一个模型,该模型通过仅使用视频片段(无需人类标签或人工注释),学习同时感知现在并预见未来。他们发现的核心在于如何训练这个系统。以往教授机器人类运动的方法之所以失败,是因为学习过程本身存在缺陷。当系统试图从视频中学习时,它会悄悄失去对人体细节(如肢体形状或衣服纹理)的理解能力,而过度专注于复制静态模式。研究人员发现,通过将系统对人体形态的记忆锚定在一个固定的起点,并迫使其预测未来而非仅仅填补过去的缺失部分,他们可以防止这种崩溃。结果显示,该模型比该领域之前的领先模型规模要小得多,但在追踪人类运动和识别个体方面表现更优,同时还保持了猜测下一步发生什么的能力。

团队面临的挑战是,现有的强大模型是基于静态图像训练的。这些模型擅长阅读照片,但不理解运动。为了创建一个理解运动中人类的系统,研究人员从一个已经从互联网学习到通用模式的视频模型开始。随后,他们对其进行了专门化处理,使其专注于人类。然而,仅仅向这个模型展示更多的行人视频是行不通的。系统会开始退化,失去识别人体部位或衣着等精细细节的能力,这种失败非常微妙,以至于训练过程甚至不会显示错误信号。模型本质上是在试图学习如何运动的同时,忘记了人类长什么样。

为了解决这个问题,研究人员引入了一种称为“锚定预测”(anchored forecasting)的方法。想象一名学生在学习一项新技能时,被要求忘记他们已掌握的基础知识;这名学生很可能会变得困惑并失去根基。研究人员通过将系统的对人体形态的理解“钉”在它原始知识的一个固定且不变的副本上,从而防止了这种情况。这个锚点确保了当模型学习预测未来运动时,不会失去识别现在的能力。此外,他们加入了一路使用人物静态图像的训练数据,这有助于系统保持对人类外观的敏锐感知。这种结合使得模型能够在学习预测运动的同时,保留对人体细节的感知。

第二个重大变化涉及系统在训练期间如何进行测试。标准方法通常要求模型填充视频中缺失的区块,这会鼓励它仅仅复制在时间和空间上靠近的内容。这是一种捷径,会阻碍模型真正学习场景是如何演变的。研究人员用纯粹的“由过去到未来”的分割方式取代了它。模型被展示一段视频剪辑的前半部分,并被要求预测后半部分。由于未来部分是完全隐藏的,成功的唯一途径就是建立一个关于场景随时间变化的真实模型。这迫使系统学习人类运动的动态,而不是仅仅记忆静态模式。

这种方法的测试结果令人瞩目。当在冻结检查点(即系统在测试期间不允许进一步学习)进行测试时,尽管参数量减少了 2.7 倍,新模型依然超越了现有的最大且最专门的人类视觉模型。它在追踪人体姿态和识别人群中的个体方面达到了更高的准确度。例如,在一次标准的行人重识别测试中,它的得分比其自身的基准版本提高了 2.7 分,并超越了领先的基于图像的专家模型。或许最重要的一点是,这些改变并没有削弱模型预测未来的能力。事实上,该系统的预测头(predictor head)是第一个在没有损害其他能力的情况下实现预测能力提升的部分。

该研究还严格测试了哪些做法是无效的,排除了几种直觉性的想法。研究人员尝试将人本身作为预测单元,通过遮蔽掉整个人的影像来观察模型是否能学会追踪他们的同伴。这种方法完全失败了,导致模型理解交互的能力崩溃。他们还发现,仅仅增加数据量或增加模型规模并不能解决由训练方法引起的底层问题。失败并非源于缺乏数据或计算能力,而是源于学习目标结构的根本缺陷。研究结论指出,理解人类在时间中的关键不仅在于观察他们,还在于锚定系统对他们形态的感知,同时迫使系统预测他们的未来。

这项工作为人工智能确立了一个新的方向。它证明了单一模型可以成功处理静态的现状感知和动态的未来预期,这两项任务此前被认为需要分别采用不同的方法。通过防止精细感知的无声崩溃,并移除阻碍真正学习的捷径,研究人员创造了一个将人视为实体(即在时间中存在、运动并变化的实体)进行观察的系统。研究结果表明,对于机器而言,要真正理解人类,必须教会它们向前看,而不只是向后看。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →