← 最新论文
💻 computer science

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

本文介绍了 Ego-OSCAR,这是一个开源、低成本(<$200)的头戴式立体惯性捕捉系统,并配备了完整的软件栈和大规模、经标注的第一视角数据集,旨在使第一视角研究中的众包数据采集实现民主化与规模化。

原作者: Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar Patnaik, Shubhanshu Khatana, Abhishek Anand

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar Patnaik, Shubhanshu Khatana, Abhishek Anand

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:Ego-OSCAR

问题陈述
视觉-语言-动作(VLA)模型与世界模型的发展正日益受到瓶颈的限制,即缺乏能够捕捉真实世界交互的多样化、大规模多模态数据集。虽然遥操作可以提供高保真数据,但其规模化能力不足;仿真模拟则面临“从模拟到现实”(sim-to-real)的差距;而自主机器人集群则受限于安全约束。第一视角(egocentric)数据采集提供了一种可扩展的替代方案,但现有方案存在权衡:消费级数据集(如 Ego4D)依赖于没有硬件同步惯性流的单目卷帘快门相机;而高保真研究平台(如 Project Aria)则是闭源、昂贵且无法向更广泛社区自由分发或复现的。因此,目前缺乏一种开源、低成本、能够大规模采集同步立体惯性数据的头戴式设备。

方法论
Ego-OSCAR 通过一个开源硬件、低成本的采集系统以及专为分布式部署设计的相应软件栈来解决这一差距。

  • 硬件设计: 该设备是一个头戴式单元(约 280 克),完全由商用现货(COTS)组件和 3D 打印部件构建,物料清单(BoM)低于 200 美元。

    • 传感器: 它使用了一个 Dexcin USB 立体相机模块,该模块包含两个通过单个 ASIC 实现硬件同步的 Omnivision 全局快门传感器。这确保了微秒级的同步,并消除了快速头部运动期间的卷帘快门伪影。系统包含一个以 120 Hz 采样的 6 轴 IMU(ICM-20948)。
    • 计算与控制: 一个 Radxa Rock 5C(Rockchip RK3588 SoC)负责硬件加速视频编码(将 MJPEG 转为 H.264)和存储。一个 Seeed Studio Xiao ESP32-S3 微控制器负责用户反馈(RGB LED 状态)、看门狗功能(检测系统挂起)以及至关重要的时钟同步。
    • 同步机制: 为了桥接相机和 IMU 之间独立的时钟,ESP32 通过中断捕获相机的曝光开始(SoE)信号。它记录每一帧曝光的单调时间戳,并将其与 IMU 数据合并。一个离线对齐过程利用视觉锚点(在第 60 次中断时闪烁的蓝色 LED)确定性地将 IMU 流与视频帧索引对齐,实现了 700 µs 的残余滞后。
    • 鲁棒性: 系统包含一个看门狗,用于检测单板计算机(SBC)的挂起情况(通过 1 Hz 心跳检测),并触发错误状态,以防止无声的数据丢失。
  • 软件流水线: 开源软件栈包括硬件加速的录制守护程序、IMU 采样服务、时间同步工具和看门狗固件。数据被分割成 5 分钟的片段,以限制断电期间的数据损失,并进行完整性验证后上传。

  • 数据集采集: 作者在六个月内将该系统部署在印度 25 名贡献者的分布式网络中,共收集了 1,462 个会话,每个摄像头累计约 550 小时的立体视频(总计 1,100 摄像头小时)。数据涵盖了多样化的室内环境,重点关注厨房活动,但也包括缝纫和裁剪。

核心贡献

  1. 开源硬件设备: 一个文档齐全、可复现的头戴式立体惯性采集装置,提供 CAD 文件、接线图和组装说明。
  2. 开源软件栈: 一个完整的录制、同步和数据管理流水线,使社区能够复现采集过程。
  3. Ego-OSCAR-550h 数据集: 一个经过策划的约 550 小时同步 IMU 的第一视角立体视频数据集。不同于原始传感器流,该发布版本包括:
    • 自由形式动作标注: 约 209,315 个片段,覆盖整个时间线且采用开放词汇。
    • 3D 手部重建: 由 WiLoR 生成的逐帧 3D 手部姿态。
    • 逐会话标定: 为每个会话提供单独的标定文件,而非仅使用标称的出厂内参。

结果与评估
论文从三个层面评估了该系统:

  • 传感器保真度: 逐会话标定产生的重投影误差低于 0.03 像素。硬件同步的全局快门和 IMU 使其在 12/20 个留置的短序列中成功实现了视觉惯性里程计(VINS-Fusion),其视觉惯性残余滞后为 700 µs。IMU 噪声水平被定性为消费级,适用于重力对齐和运动分类,但不适用于在不更换更高等级传感器的情况下进行长程惯性积分。
  • 数据效用: 立体深度估计(SGBM, RAFT-Stereo)在 126° 全视场范围内均取得成功。手部检测率达到 94%,表明头戴式几何结构有效地使双手在大多数交互过程中保持在视野内。
  • 部署规模: 该系统在 1,462 个会话中实现了 96% 的可用会话率。通过硬件修订(散热片、机械加固)和软件验证,识别并缓解了失效模式(热关机、SD 卡 I/O 错误、线缆应力)。

意义与主张
论文将 Ego-OSCAR 定位为并非在单体保真度上取代 Project Aria 等研究级系统,而是作为“众包第一视角采集中最廉价且具有防御性的底层基质”。其主要意义在于降低了团队大规模采集第一视角数据的准入门槛。通过提供一个完全开放、可复现且负担得起的平台,Ego-OSCAR 旨在实现高质量同步立体惯性数据的采集民主化,从而补充现有的单目或闭源平台数据集。作者明确指出,证明该数据能带来端到端策略增益是未来的工作;目前的贡献是实现此类研究所需的基础设施和数据集。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →