✨ 要点🔬 技术摘要
想象一下,你想要教一个机器人完成一项复杂的任务,比如折叠衣服或搭建积木塔。在过去,这就像是在隔壁房间对着戴着眼罩的狗大喊指令来教它跳舞一样。你必须使用昂贵的定制控制器,收集到的数据杂乱且难以分享,而且如果你想从控制一个小机械臂切换到控制一个全身机器人,通常必须从头开始。
BEAVR 是一个全新的开源系统,它改变了游戏规则。你可以把它想象成一个使用虚拟现实(VR)头显来控制机器人的**“万能遥控器”**。
以下是它的工作原理,通过简单的概念进行拆解:
1. “魔镜”(遥操作)
你不再需要使用摇杆或复杂的键盘,而是戴上一个标准的 VR 头显(如 Meta Quest)。系统利用头显的摄像头在 3D 空间中追踪你的双手。
类比: 想象你戴着一面“魔镜”,它能瞬间复制你的手部动作并将其发送给机器人。如果你伸手去抓一个杯子,机器人的手也会伸手去抓杯子;如果你转动手腕,机器人的手腕也会随之转动。
神奇之处: 无论你控制的是桌上的小机械臂,还是看起来像人类的全尺寸机器人,BEAVR 都能将你的手部动作转化为适配任何 机器人的指令,无论它是拥有 7 个关节还是 24 个关节。
2. “即时翻译机”(零拷贝架构)
远程控制中最大的问题之一是延迟 (即你在移动手部与机器人移动之间的延迟)。
类比: 通常,发送数据就像寄信:你写好信,装进信封,开车去邮局,然后等待投递。而 BEAVR 就像是一个**“心灵感应链接”**。它使用了一种“零拷贝”系统,意味着它不会在不同的计算机程序之间浪费时间进行数据复制。它直接流式传输数据,就像实时视频流一样,几乎没有延迟(低于 35 毫秒)。
结果: 机器人的动作几乎与你的动作同步,这让控制感觉非常自然流畅,即使你同时在控制两个机器人也是如此。
3. “通用笔记本”(数据与学习)
当你通过亲自动手移动机器人来教它时,你实际上是在创造一次“演示”。在 BEAVR 出现之前,这些演示通常以奇怪的、专有的格式保存,只有特定的机器人才能读取。
类比: 想象你用一种只有你奶奶才懂的秘密代码写了一份食谱。如果你想分享给一位厨师,他们无法阅读。BEAVR 则将食谱写成了 LeRobot 格式,这是一种所有现代机器人学习 AI 都能理解的标准“语言”。
益处: 你可以记录你的动作,保存它们,并立即使用这些数据来训练 AI 机器人让其自主完成任务。该系统内置支持最新的 AI 工具(如 ACT 和 DiffusionPolicy)。
4. “经济实惠”的配置
许多机器人系统动辄耗资数十万美元。
类比: BEAVR 就像是用你在当地汽车配件店就能买到的零件组装出一辆高性能赛车。作者展示了你可以仅用约 1,000 美元 就搭建出一套完整的配置(包括机器人手、机械臂和 VR 头显)。这使得先进的机器人研究不再是巨型企业的专利,而是让大学、小型实验室和爱好者也能触手可及。
他们证明了什么?
研究人员通过让人类使用 BEAVR 完成六项棘手的任务来测试该系统,例如:
翻转方块。
将水从一个杯子倒入另一个杯子。
堆叠不同大小的积木。
拿起灯笼并将其放置在箱子上。
研究结果:
成功率: 使用 BEAVR 的人类能够非常成功地完成这些任务(在翻转方块等简单任务中,成功率经常达到 100%)。
速度: 该系统足够快,可以处理高速运动而不会出现卡顿。
可扩展性: 他们证明了该系统在控制一个机械臂和同时控制两个机械臂时表现同样出色,系统不会出现“拥堵”或变慢的情况。
AI 训练: 他们利用从人类那里收集的数据训练了 AI 模型。这些 AI 模型能够自主完成任务,证明了 BEAVR 是教机器人如何思考的绝佳工具。
总结
BEAVR 是一个免费、廉价且灵活的工具包 ,它让任何人都能使用 VR 头显来控制几乎任何机器人。它消除了昂贵硬件和复杂软件带来的障碍,让研究人员能够专注于最有趣的部分:教机器人完成有用的、灵巧的任务,并让 AI 从这些经验中学习。
技术摘要:BEAVR
问题陈述
目前的机器人遥操作系统面临严重的碎片化问题,通常与特定硬件、专有数据格式或定制框架绑定。这种缺乏标准化的现状阻碍了可复现性,并减缓了人类-机器人交互(HRI)和策略学习的进展。虽然近期的基于虚拟现实(VR)的遥操作系统(如 OpenTeach、Bunny VisionPro)提供了沉浸式界面,但它们往往存在学习曲线陡峭、文档难以获取、数据记录非标准化以及缺乏通向学习就绪数据集的标准桥梁等问题。此外,现有解决方案在跨异构机器人平台(从 7 自由度机械臂到全身类人机器人)进行扩展时,往往难以避免延迟惩罚,或需要专门的网络基础设施。
方法论
BEAVR(Bimanual, multi-Embodiment, Accessible, Virtual Reality Teleoperation System for Robots,即:双臂、多具身、易用、虚拟现实机器人遥操作系统)是一个旨在统一实时控制、数据记录和策略学习的开源框架。该系统架构分为三个主要模块:
遥操作模块:
输入: 利用商用 Meta Quest 3S VR 头显以 90 Hz 的频率捕捉 24 个符合 OpenXR 标准的手部关键点。
处理: 采用模块化、基于组件的设计,通过 ZMQ 通道由三个独立的进程进行通信:
检测器 (Detector): 捕捉原始关键点数据和会话命令。
操作器 (Operator): 将输入数据转换为机器人相关的指令。这包括使用 Gram-Schmidt 正交化构建稳定的手部坐标系、进行坐标变换(将 VR 的 Y-up 转换为机器人的 Z-up)以及根据特定的具身形态(例如手部 vs. 夹爪)进行比例缩放调整。
接口 (Interface): 向机器人的控制系统发送高层动作。
控制求解器: 实现了一个使用阻尼最小二乘法(DLS)的多目标逆运动学(IK)求解器,以优化八个指尖位置。它结合了防碰撞程序和时间平滑处理(移动平均和四元数 SLERP 插值),以确保稳定且低抖动的控制。
数据采集模块:
直接与 LeRobot 框架集成,以记录同步的观测、动作和元数据流。
以标准化的 LeRobot 数据集模式导出数据(使用用于表格的 Arrow/Parquet 和用于视频的 MP4),从而实现下游模仿学习的即时应用。
支持使用商用摄像头进行实时的 RGB 和 RGB-D 视频流传输。
模型训练模块:
利用 LeRobot 的训练流水线,并配备增强的异步“思考-行动”(think–act)控制循环。
一个专门的控制循环以固定频率流式传输动作,而另一个推理线程则根据资源情况计算策略输出,通过将计算与实时执行解耦,以在高负载下保持性能。
通信架构:
利用基于 ZMQ 的零拷贝、线程安全网络 API 来管理发布-订阅和请求-响应模式。
设计用于处理多机器人和高频指令流,且不会出现数据竞争或系统崩溃。
核心贡献
本文提出了四个主要贡献:
硬件无关接口: 一种 VR 遥操作界面,能够通过单一接口实现从 7 自由度桌面机械臂(如 xArm7)到全身类人机器人(如 RX-1)及灵巧手(如 LEAP Hand)的扩展。
低延迟流式传输架构: 采用零拷贝设计,在商用网络上实现了 ≤35 ms 的端到端延迟和亚毫秒级的抖动。
数据集原生记录器: 一个能直接将演示数据导出至 LeRobot 模式的系统,促进了与现代模仿学习框架的即时集成。
开放基准测试套件: 发布内容包括六个操纵任务、50 个专家演示以及预训练基线策略(ACT、DiffusionPolicy、SmolVLA)。
实验结果
作者从任务性能、策略学习和系统可扩展性三个维度对 BEAVR 进行了评估。
任务性能: 系统在六个任务(如堆叠方块、翻转方块、倾倒、操作胶带)上进行了测试。在 10 次试验的设置中,BEAVR 实现了从 60%(胶带任务)到 100%(翻转方块、取放物体)不等的成功率。在针对“翻转方块”和“取放物体”等特定任务与基线(OpenTeach、Holo-Dex、Any-Teleop)对比时,BEAVR 展示了具有竞争力或更优的成功率,尽管完成时间因硬件差异(例如使用 LEAP 手部 vs. 标准夹爪)而有所不同。
策略学习: 使用通过 BEAVR 收集的 50 个专家演示,作者训练了动作分块 Transformer (ACT)、动作扩散 (Action Diffusion) 和 SmolVLA。在“捡起盒子”任务中,ACT 实现了 100% 的成功率(平均时间 9.16s),Diffusion 实现了 80%(23.88s),SmolVLA 实现了 70%(33.84s)。人类操作员实现了 100% 的成功(12.08s)。
系统性能与可扩展性:
延迟: 在 90 Hz 下,BEAVR 实现了约 10 ms 的单向延迟和亚毫秒级抖动。在 30 Hz 下,延迟约为 33 ms。这些指标优于典型的基于 Wi-Fi 的遥操作系统,并与 Vicarios 等基于 VR 的界面相比具有竞争力。
频率稳定性: 在单臂、双臂和多机器人(最多 4 个末端执行器)配置下,系统将控制频率维持在目标速率的 99.2%–99.4% 之内。
抖动: 即使在扩展到多个机器人或增加指令速率时,抖动也始终保持在较低水平(机械臂 <0.90 ms,手部 <0.22 ms),这表明瓶颈在于局部控制循环而非 BEAVR 架构。
成本: 整套配置(VR 头显、机器人、舵机、打印部件)的估算成本约为 1,080 美元,凸显了系统的经济性。
重要性与主张
论文声称 BEAVR 通过提供一个统一的开源平台,弥合了遥操作与数据驱动策略学习之间的鸿沟,解决了机器人研究中的关键障碍。其重要性在于:
民主化: 降低了高质量灵巧遥操作和策略训练的技术门槛和成本。
标准化: 提供了一套标准化的数据采集流程(LeRobot),消除了对自定义数据格式的需求,并促进了社区范围内的基准测试。
可扩展性: 证明了单个 VR 界面可以在不产生显著延迟惩罚或不需要专门网络基础设施的情况下,控制异构机器人(机械臂、手部、类人机器人)。
模块化: 提供了一个灵活的架构,通过更新变换矩阵和求解器目标即可集成新的具身形态,而无需重新设计整个流水线。
作者将 BEAVR 定位为不仅是一个遥操作工具,更是一个基础框架,旨在通过易获取、可复现且可扩展的数据采集,推动灵巧操纵和多机器人协作领域的研究。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。