FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor
FORGE-plus 引入了一个两层框架,该框架利用冻结的大语言模型(LLM)根据文本特征分配力上限并选择恢复动作,从而使底层控制器能够在不直接控制力或超过安全限制的情况下,实现具有紧配合间隙且具备防滑恢复能力的鲁棒、无损接触密集型装配。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:机器人就像一群试图用一盒乐高积木搭东西的笨拙幼儿,但这些乐高是由玻璃制成的,而且说明书是用一种机器人听不懂的语言写的。这就是**接触密集型装配(contact-rich assembly)**面临的挑战:教机器如何温柔地推动、滑动并将零件组装在一起,而不至于弄碎它们。在过去,机器人通过试错法来学习,通常是不断撞击零件,直到它们摸索出正确的力度。但如果零件过于脆弱,根本经不起撞击怎么办?
为了解决这个问题,科学家们结合了强化学习(Reinforcement Learning, RL)——即机器人通过获得成功积分和惩罚错误来进行学习——以及大语言模型(Large Language Models, LLMs)——也就是那种可以写故事或回答问题的同类人工智能。核心问题在于:我们如何告诉机器人该用多大的力去推,以及当它卡住时该怎么办?如果机器人把螺钉卡住了,本能反应通常是“加大力气”。但如果你手里拿着一个脆弱的玻璃瓶,加大力气是最快让它变成一堆碎片的做法。这篇论文探索了一种新方法,旨在教机器人变得温柔、聪明且安全,它使用了一个模拟环境,其中的“零件”如果受力过大就会破碎。
带着“别碰那个”告示牌的机器人
见见 FORGE-plus,这是一个旨在帮助机器人组装精细物品的新系统,例如将玻璃瓶放入酒架,或者将一个微小的齿轮滑入几乎没有晃动空间的轴上。研究人员为机器人构建了一个双层大脑,它的工作方式有点像一个严厉的老板和一个反应敏捷的机械师。
老板(冻结的 LLM):
在机器人接触物体之前,一个“冻结”的 AI(一个在任务过程中不学习也不改变的智能文本阅读器)会查看物体的名称和描述。这就像老板在阅读一张写着“易碎玻璃”或“钢制齿轮”的标签。基于这些文本,老板会设定一个力上限(force ceiling)。你可以把它想象成一个力的速度限制标志。如果是一个脆弱的瓶子,老板会说:“你推的最大力量不能超过 8.8 牛顿。”如果是一个坚固的钢制齿轮,限制就会更高。至关重要的一点是,即使机器人被卡住了,它也无法要求老板更改这个限制。
机械师(快速控制回路):
机器人的手以极快的速度移动,由一个快速计算机回路引导。这个回路有一个硬性的“夹钳(clamp)”,起到了安全阀的作用。无论机器人的大脑如何思考,夹钳都会从物理层面阻止机器人推得比老板设定的限度更重。如果机器人试图以 10 牛顿的力量推送,夹钳会瞬间将其削减到限制值。这确保了即使机器人犯了错,它也不会因为推得太用力而损坏物体。
当情况出错时会发生什么?
在现实世界中,东西会卡住。也许瓶子撞到了架子的边缘,或者齿轮在夹具内部发生了倾斜。在过去,机器人可能会尝试“用力压”来强行通过。研究人员测试了这种“加压”策略,结果是一场灾难。在一种类型的夹具上,这除了浪费时间外毫无作用;而在另一种夹具上,它导致了 96% 的脆弱零件破碎。
FORGE-plus 采取了不同的方法。当机器人卡住时,它不会要求老板提高限度。相反,它会观察一个力特征(force signature)。想象一下,机器人正在通过传感器倾听接触产生的“声音”。一个卡住的瓶子发出的声音与一个卡住的齿轮是不同的。机器人会将这种“声音”(实际上是力的简短文本描述)发送给老板。然后,老板会从一个固定的菜单中选择一个恢复动作,比如“摇晃”、“旋转”或“松开并重试”。
神奇之处在于,机器人从未增加过力限。它只是在安全限度内尝试不同的动作。如果瓶子卡住了,机器人可能会轻微旋转它以寻找缝隙,而不是硬生生地向下压。
结果:模拟环境中的成功案例
研究人员在高度真实的计算机模拟环境(使用 Isaac Lab)中,使用两种不同的机器人手进行了测试:一个 Robotiq 夹具和一个 Franka Panda 手。他们使用了两个主要任务:
- 瓶子: 将一个脆弱的玻璃瓶放入架子中。
- 齿轮: 将一个齿轮滑入一个间隙仅为 0.4 毫米(比人类头发还细)的轴上。
好消息:
该系统在模拟实验中表现得非常出色。单个机器人“大脑”(检查点)成功地将脆弱和坚固的齿轮都安装到位,256 次尝试中成功了 256 次,且没有损坏任何一个零件。它还学会了在何时完美地释放物体,实现了零失误释放。即使当机器人打滑并在错误的角度抓住了齿轮时,系统也会利用力特征意识到:“嘿,我拿歪了”,然后决定将它放回桌上并重新抓取。这种“重新抓取”策略挽救了局面,根据机器人手的不同,它成功化解了 40% 到 64% 的卡顿。
坏消息(以及重要的教训):
这篇论文也因其“失败之处”而闻名。研究人员尝试使用一种标准的学习方法,称为 PPO(通常用于通过随机探索来帮助机器人学习)。他们发现,在如此微小的 0.4 毫米间隙下,机器人的随机“探索”动作幅度太大,导致在机器人学会如何匹配之前,就直接弄碎了脆弱的零件。这就像试图通过把针扔向线头来穿针引线一样;你永远无法成功,只会把针弄断。
他们还发现,如果你试图通过让机器人推到接近破碎点的程度来教它达到“最优状态”,它反而更容易失败。因为机器人的动作存在一点“过冲(overshoot)”(即在停止前会稍微推得过重),所以即使设置在刚好达到破碎点的限度,仍然会导致零件破碎。由老板(基于物体身份)设定的“安全”限度,实际上比通过“作弊码”计算出的“完美”限度效果更好。
这为什么重要
这篇论文并不声称已经制造出了能在真实工厂里做这些工作的机器人;这目前还处于模拟阶段。但它证明了一个强大的理念:安全性并不来自于机器人足够聪明到知道何时停止,而是来自于一个机器人无法逾越的硬性限度。
通过将“思考”(老板设定限度)与“执行”(快速夹钳强制执行)分离,该系统确保了机器人可以在尝试解决问题的同时,永远不会产生破坏性行为。它表明,对于精细的任务,最好的策略不是推得更用力,而是更聪明地进行推力操作,并拥有一条严格的规则,即:“无论如何,你都不准推这么大力。”
最终,FORGE-plus 暗示,未来精细机器人工作的关键不在于构建更强壮、更聪明、能猜准力度的 AI,而在于构建被迫保持温柔的系统,即使用一个机器人必须遵守的“力预算”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。