← 最新论文
🤖 AI

Compact Visuotactile World Models for Lifting: Prediction, Reward Alignment, and Force Constraints

本文研究了将视觉触觉感知集成到紧凑型世界模型中如何显著提升机器人提升任务中的接触预测与奖励对齐,尽管研究也揭示了在实现高任务成功率与严格遵守力约束之间存在持续的权衡,且未展示模拟到现实的迁移能力。

原作者: Qinzhen Ma (Rice University), Sida Peng (Zhejiang University)

发布于 2026-09-10✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Qinzhen Ma (Rice University), Sida Peng (Zhejiang University)

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人在开阔世界中表现出色,能够精准地在平整地面上移动,并抓取远处可见的物体。但就在机器人的手触碰到物体的瞬间,规则改变了。视觉依赖于光线和形状,而这一刻,它突然遭遇了摩擦力、压力以及维系物体结合的无形力量所构成的混乱且隐蔽的现实。要从仅仅“看到”一个物体进化到真正地“操控”它,机器必须学会“感知”。这就是接触密集型操控(contact-rich manipulation)面临的挑战——其目标不仅是预测物体会移动到哪里,而是要精确理解该施加多大的推力,既不会将其压碎,也不会让其滑落。研究人员目前正在构建紧凑的数字模型,试图将机器人的摄像头与其触觉传感器结合成一种统一的世界感官,希望让机器人能在移动之前,就能想象出触碰带来的未来后果。

在最近的一项研究中,科学家们调查了赋予机器人触觉是否真的有助于其在提升物体时做出更好的决策。他们为模拟机器人手臂创建了一个紧凑的数字大脑,使其能够观察场景并感知指尖的压力。研究人员训练这个系统去预测接下来的变化:物体会上升多高,以及有多少力量会压在机器人的手指上。他们在一项简单的任务上对其进行了测试:提升一个立方体。结果呈现出令人惊喜的成功与令人清醒的局限性并存的状态。当机器人同时使用视觉和触觉时,它在预测施加的确切力量方面变得更加出色。在数字模拟中,预测力量的误差从超过 1 牛顿降至仅为几分之一牛顿。这似乎是为机器人增加触觉感官所取得的一次明确胜利。

然而,故事并未就此结束。研究人员发现,一种非常简单的策略——即假设力量会与上一时刻保持完全一致——在处理分布内数据(on-distribution data)时,预测峰值压力的表现竟然比复杂的学习模型还要好。这种“持续性”(persistence)技巧之所以奏效,是因为提升过程中的力量变化通常较为缓慢,使得复杂模型的额外努力在某些特定测量中显得并无必要。更重要的是,研究发现,具备预测数值的能力并不自动意味着具备完成任务的能力。当研究人员让机器人在模拟器中尝试提升物体时,最初学习了触觉的模型在成功率上表现挣扎;但在经过匹配的奖励修正后,在模拟环境中将物体提升 10 厘米的成功率从 20.0% 大幅跃升至 93.3%。尽管有了这一改进,该机器人仍然无法达到一个简单的直接力反馈系统的性能,后者能根据即时压力读数实时调整抓握力度。即便经过改进,学习模型仍然明显逊色于直接反馈系统:在力预算范围内的成功率仅为 33.3%,而力反馈系统则达到了 70.0%。

研究人员还观察了这些预测在整个提升路径上的可靠性,而非仅仅关注某一瞬间。他们发现,虽然该模型在平均水平上可能很准确,但往往会错过那些可能导致失败的罕见且剧烈的压力峰值。当他们尝试围绕这些预测建立一个安全裕度以捕捉这些峰值时,系统虽然减少了力量违规情况,却以牺牲任务完成率为代价。研究结论指出,虽然增加机器人的触觉感官可以提高其预测力量的能力,但尚未解决更难的问题,即如何利用这些预测在严格的物理限制下安全地控制机器人。要实现让机器人真正通过触觉完成精细任务,所需的不仅仅是更好的传感器或更聪明的预测,更需要对如何将这些预测转化为安全、可靠的动作有更深刻的理解。这项工作目前仍处于模拟阶段,是一个概念验证,凸显了“知其然”与“行其然”之间的差距。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →