← 最新论文
💻 computer science

EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction

本文介绍了 EgoTraj,这是一个新颖的开放多模态数据集,包含通过 Meta Quest Pro 头戴设备捕获的 75 个真实世界城市导航序列,并配有同步的 RGB 视频、六自由度头部姿态和三维眼动注视数据,旨在推动机器人和辅助系统中以自我为中心的人类轨迹预测研究。

原作者: Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于EgoTraj论文的解释,已用日常语言并辅以一些富有创意的类比进行翻译。

核心理念:穿上他人的鞋子看世界

想象一下,你正在教机器人如何穿过繁忙的城市。大多数机器人是通过观看从鸟瞰视角(就像无人机在城市上空盘旋)拍摄的视频来学习的。它们能看到人们“去”哪里,却无法理解人们“为何”去那里,或者他们在看什么。

这篇论文介绍了EgoTraj,这是一个旨在解决该问题的新数据集。与无人机的视角不同,EgoTraj 以人类自己的眼睛所见的视角来记录世界。这就像给机器人戴上了一副“魔法眼镜”,它不仅展示视频,还能精确追踪佩戴者看向何处、头部如何移动,以及周围世界看起来是什么样子。

“魔法眼镜”(硬件)

研究人员使用Meta Quest Pro头戴设备(即你可能用于游戏的 VR 护目镜)来收集这些数据。可以将这些头戴设备想象成高科技间谍装备,它能同时捕捉三样东西:

  1. 电影: 人物所见的全彩视频(即“第一人称”视角)。
  2. 头部运动: 人物头部转动和移动的精确定位图(6 个自由度)。
  3. 视线凝视: 一个激光指示器,显示人物在每一瞬间确切看向哪里。

“实地考察”(数据收集)

研究团队并没有只是让人在实验室里走直线。他们派遣了75 名不同的志愿者进入真实、繁忙的城市。

  • 任务: 每个人被给予两个地标(例如“从图书馆开始,到咖啡店结束”),但可以自由选择适合自己的路线。他们可以抄近道、穿过繁忙的街道,或在人群中穿梭。
  • 结果: 这创建了一个包含10.7 小时步行数据的庞大图书馆。它包含超过100 万帧视频,记录了 75 个独特个体在真实城市混乱环境中的导航情况。
  • 多样性: 该群体在年龄、性别和国籍方面具有多样性,确保数据代表真实的人类行为,而不仅仅是单一类型的步行者。

“秘密配方”(为什么这个数据集很特别)

以前的数据集就像在看地图;而 EgoTraj 就像坐在驾驶座上。

  • 视线关联: 论文强调了一个关键发现:人类在移动之前会先观察。 如果你要转弯,你的眼睛通常会在身体转动前 1-2 秒看向那个方向。EgoTraj 捕捉到了这种“前瞻”行为。
  • 标注: 研究人员使用了一种智能 AI(视觉 - 语言模型)来观看视频并记录发生的事情。它不仅仅说“一个人正在走路”;它说“这个人正在看红灯,并等待过马路”。这为数据增加了一层“意图”。

“试驾”(基准测试)

为了证明这些数据有用,研究人员测试了几种计算机模型(算法),看它们能否预测一个人接下来会走向哪里。

  • 旧方法: 仅观察过去运动轨迹的模型(就像汽车仅根据当前速度猜测去向)经常失败。它们往往会转弯过度或错过突然的停止。
  • 新方法: 使用EgoTraj数据的模型——特别是那些关注**人物看向何处(视线)以及周围环境(场景上下文)**的模型——表现要好得多。
  • 获胜者: 表现最佳的模型将人物的运动历史与其视线凝视及场景描述相结合。这就像有一个副驾驶说:“嘿,他们正看着那个斑马线,所以他们可能会停下来。”

“仪表盘”(供他人使用的工具)

该团队没有仅仅保留数据;他们构建了一个仪表盘(称为 EgoViz)。想象一个驾驶舱,你可以在其中观看视频,查看人物走过的 3D 路径,并观察一个小箭头精确显示他们的眼睛看向哪里,所有这些都完美同步。这有助于其他科学家检查数据并构建更好的系统。

这为何重要?(根据论文所述)

论文指出,该数据集是以下领域的垫脚石:

  • 辅助导航: 通过根据视线预测盲人或视障人士“想要”去的方向,帮助他们安全导航。
  • 机器人技术: 通过理解人类的社会线索和注意力,教导人形机器人如何在人群中行走而不撞到他人。
  • 增强现实(AR): 让 AR 眼镜变得更智能,以便在恰当时机提供有用的指导(例如“小心那辆车”)。

简而言之,EgoTraj是一个庞大、高质量的“由内而外的人类行走”图书馆,包含眼动追踪和场景描述,旨在帮助机器不仅理解我们“去”哪里,而且理解我们“为何”去那里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →