想象一下,教机器人拿起一颗成熟的草莓而不将其捏碎,或者将一只易碎的茶杯递给一个人而不弄断把手。这就是“轻柔操控”所面临的挑战。
目前,大多数先进的机器人“大脑”(称为视觉 - 语言 - 动作或 VLA 模型)就像那些读过数百万本书、看过数十亿张照片却从未触摸过任何东西的人。它们知道杯子长什么样,也明白“杯子”这个词的含义,但它们不知道应该用多大的力气去握它。如果你让它们“轻轻拿起杯子”,它们可能会用和拿起石头时同样巨大的握力去抓取,因为它们缺乏触觉。
这篇论文介绍了Tabero,这是一个旨在赋予机器人这种缺失的触觉并教会它们如何轻柔操作的新系统。以下是其工作原理的分解说明:
1. 问题:机器人是“触觉盲”
现有的机器人模型仅基于机器人看到什么和做了什么的数据进行训练。它们缺乏触觉数据(关于压力、纹理和力的信息)。
- 类比:想象一下,你戴着厚厚的拳击手套,试图通过观看别人拿鸡蛋的视频来学习如何拿鸡蛋。你能看到鸡蛋,但无法感觉到自己是否握得太紧。
- 后果:没有触觉,机器人要么会掉落物品,要么会将其压碎。
2. 解决方案:Tabero(“触觉训练”健身房)
作者创建了一个名为Tabero的新系统,以解决两大问题:触觉数据的缺乏以及衡量“轻柔度”的方法缺失。
- 复用旧数据:Tabero 没有从零开始建造昂贵的机器人来收集新数据,而是利用现有的开源机器人运动数据(如旧的训练视频),并在一个超先进的计算机模拟中“重放”这些数据。
- 添加触觉:在这个模拟中,他们为机器人配备了虚拟“皮肤”(触觉传感器)。当机器人在模拟中移动时,它不仅记录所见,还记录指尖感受到的压力。
- 结果:他们创建了一个庞大的数据库,其中包含视觉( sight)、语言(指令)和触觉(压力),所有数据都完美同步。
3. 新的机器人大脑:Tabero-VTLA
利用这些新数据,他们构建了一个名为Tabero-VTLA的新机器人模型。
- “解耦”的大脑:可以将这个机器人的大脑想象成有两个独立的任务。一部分决定手移动到哪里(位置),另一部分决定握得多紧(力)。
- 反馈回路:当机器人移动时,它的“皮肤”会感受到压力。如果感觉到握力过大,它会立即调整抓握力度,就像你感觉到手中的鸡蛋开始破裂时会做的那样。
- 结果:机器人通过实际感受力量并实时调整,学会了遵循“轻轻拿起”之类的指令。
4. 如何衡量成功:“轻柔度评分”
通常,我们只问机器人:“你完成任务了吗?”(是/否)。Tabero 引入了一种新的评分方式:
- 任务成功:机器人是否拿起了物体?
- 交互质量:它是否弄坏了物体?
- 指标:他们测量诸如“平均握力”(它握得有多紧)和“最大瞬态力”(可能导致损坏的压力突然峰值)等指标。
- 类比:这就像是一个靠猜题得"A"的学生,与一个靠完全理解材料得"A"的学生之间的区别。Tabero 确保机器人理解任务的物理原理,而不仅仅是结果。
5. 结果
当他们测试该系统时:
- 机器人能够遵循“轻柔”或“稳固”的指令。
- 在“轻柔”指令下,与标准机器人相比,该机器人的握力降低了70% 以上。
- 关键在于,它并没有变得无力;它仍然成功拿起了物体。它学会了灵巧,而不仅仅是柔软。
总结
Tabero是一套教机器人通过“感觉”来完成任务的工具包。通过在计算机中模拟触觉并训练一种新型 AI 模型,研究人员表明,机器人可以学会以类似人类的关怀来处理易碎物体,在降低损坏风险的同时仍能完成任务。
注:该论文完全专注于模拟和数据生成。文中提到他们未来正在开发真实世界的系统,但此处展示的结果来自他们的高保真模拟环境。
技术摘要:Tabero——利用闭环力反馈学习温和操控
1. 问题陈述
当前的视觉 - 语言 - 动作(VLA)基础模型在机器人操控方面展现了显著进展,但主要依赖视觉和语言数据,缺乏实现类人温和交互所必需的触觉模态。这一局限性阻碍了 VLA 模型执行力敏感任务,例如在不损坏物体的情况下处理易碎物品。该领域面临两大主要挑战:
- 数据稀缺:缺乏大规模对齐的视觉 - 触觉 - 语言数据集。现有的触觉数据收集受限于定制硬件的高昂成本和复杂性,而仿真流程往往难以生成高保真、同步的触觉信号。
- 评估缺口:标准评估协议仅关注任务成功率(结果导向),忽视了物理交互的质量(过程导向)。它们无法量化在操控过程中物体是否受损或是否施加了过大的力。
2. 方法论
2.1 Tabero 基准与数据流程
为解决数据稀缺问题,作者引入了Tabero,这是一个旨在高效生成多样化视觉 - 触觉 - 语言数据的基准和模型套件。
- 跨平台数据复用:Tabero 并非从头收集数据,而是通过在 Isaac Sim 高保真环境中重放,复用开源机器人操控轨迹(最初来自 MuJoCo 或其他平台)。
- 硬件适配:该流程将轨迹适配到配备视觉 - 触觉夹爪(集成模拟 GelSight 传感器)的机器人上。为处理末端执行器几何形状和控制动力学(例如从操作空间控制切换到关节控制)的差异,系统调整机器人基座位姿,并采用高增益 PD 关节控制器以最小化跟踪误差。
- 多模态采集:系统以 20 Hz 的频率采集同步流,包括:
- 视觉:来自腕部安装相机和第三人称相机的 RGB-D 数据。
- 触觉:通过 Taxim 框架生成的高分辨率触觉图像(320×240)和标记位移场。
- 力:来自模拟指尖的真实 6D 接触力。
- 力多样性生成:为克服标准夹爪指令的二元性,流程调节底层阻抗控制器的参数(Kp和Kd)。这使得在保持高层任务逻辑不变的同时,能够生成具有不同力幅值(例如“温和”与“稳固”)的轨迹。语言指令通过添加副词(例如“轻柔地”、“稳固地”)进行增强,以使语义与测量的力保持一致。
2.2 Tabero-VTLA 架构
作者提出了Tabero-VTLA,这是一个基于 Pi0 基础设施并采用流匹配(flow matching)构建的力感知模型套件。
- 触觉标记化:模型通过专用标记器整合触觉数据:
- 力场标记器:使用时序卷积网络(TCN)编码时空标记位移场。
- 触觉图像适配器:通过视觉编码器处理复合触觉图像。
- 力标记器:通过多层感知机(MLP)编码原始 6D 力向量。
- 解耦力 - 位置控制:策略输出协调的夹爪位姿和目标力指令。这些指令由固定的混合底层控制器执行,该控制器不学习顺应性,而是跟踪策略的指令。
- 施加力控制:使用基于导纳的位置校正,根据目标接触力与测量接触力之间的差异来调整末端执行器位姿。
- 夹持力控制:实施带有前馈增益的反馈回路以精确调节夹持力,并利用死区处理执行器的不精确性。
2.3 评估协议
本文引入了一种多维评估协议,超越二元成功率,量化交互质量:
- 最大瞬态夹持力(MG):前 5% 夹持力值的平均值(捕捉激进的峰值)。
- 平均夹持力(AG):接触期间的平均夹持力。
- 最大瞬态施加力(MA):前 5% 施加力幅值的平均值。
- 平均施加力(AA):平均施加力幅值。
3. 关键结果
3.1 数据验证与多样性
- 保真度:在使用相同运动学的前提下,Isaac Lab 中重放的轨迹取得了与原始 MuJoCo 数据集相当的成功率。然而,引入配备触觉传感器的夹爪后,精细任务的成功率出现可测量的下降,突显了富含接触的任务对力调节的敏感性。
- 力分布:数据生成流程成功为不同的力水平(标称力的 100%、25% 和 10%)创建了独特的多模态分布,触觉图像和力场呈现出与“稳固地”与“轻柔地”等语言指令相对应的清晰变化。
3.2 模型性能
- 触觉反馈的必要性:消融实验表明,移除触觉输入会导致力调节完全失败。没有触觉反馈的模型无法根据语言指令调整夹持力。
- 力监督:添加显式的力监督显著提升了性能。表现最佳的配置结合了丰富的触觉表示(标记场)与力监督,在“稳固”条件下实现了 0.86 的成功率,在“温和”条件下(数据集 B)实现了 0.52 的成功率,同时与稳固夹持相比,平均夹持力降低了 70% 以上。
- 控制器有效性:对底层控制器的消融实验表明,前馈项和导纳项对于精确的力跟踪都至关重要。移除任一项都会导致力调节不佳或物体掉落。
3.3 语义泛化
该模型展示了泛化到未见过的语言副词(例如“轻轻地”、“用力地”)的能力。虽然对于域外指令的成功率有所下降,但该模型产生了与副词语义含义相一致的中间力水平,表明其对力相关语言具有一定的零样本组合理解能力。
4. 意义与主张
本文主张 Tabero 为在富含接触的环境中实现更安全、更灵巧的机器人交互提供了一条实用途径。其主要贡献包括:
- 可扩展的数据生成:建立了首个通过复用现有开源轨迹来生成大规模、同步的视觉 - 触觉 - 语言数据集的流程,从而解决了数据稀缺瓶颈。
- 标准化评估:引入了首个标准化协议,在任务成功的同时明确量化交互的“温和度”,将关注点从纯粹的结果指标转向过程感知的物理交互质量。
- 力感知控制:证明了通过解耦的力 - 位置接口将触觉反馈集成到 VLA 架构中,可使机器人在保持高任务成功率的同时显著降低交互力(降低>70%),这是标准 VLA 模型此前无法实现的能力。
5. 局限性
作者承认,当前框架并未同时优化任务成功率和最小交互力,指出在超温和 regimes 中存在温和性与可靠性之间的固有权衡。他们建议未来的工作可以探索强化学习以平衡这些目标,并正在开发用于物理部署的真实世界数据收集系统。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。