Contextual Safety Reasoning and Grounding for Open-World Robots
本文提出了名为 CORE 的安全框架,该框架利用视觉语言模型实时推理环境上下文并生成安全规则,结合控制障碍函数在无需预先环境知识的情况下,为开放世界机器人提供具备感知不确定性的概率安全保证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 CORE 的新系统,它就像给机器人装上了一副“有常识的超级眼镜”和一颗“谨慎的大脑”,让机器人能在完全陌生的环境中安全地行动。
想象一下,如果你被蒙上眼睛扔进一个从未去过的陌生城市,你只能靠听声音和偶尔掀开眼罩看一眼来走路。传统的机器人就像是一个只会看“硬障碍”的机器人:它知道“墙”和“桌子”不能撞,但如果看到地上有个“小心地滑”的牌子,或者看到一群人正在开会,它可能就会傻傻地直接冲过去,因为它只认物理障碍,不懂“语境”。
CORE 系统是如何解决这个问题的呢?我们可以把它想象成三个步骤的“安全特工”:
1. 像侦探一样“看图说话” (视觉 - 语言推理)
传统的机器人需要人类提前把地图和所有规则(比如“别进厨房”)写进它的代码里。但 CORE 不需要。
- 比喻:CORE 里住着一个超级聪明的 AI 侦探(基于视觉 - 语言模型,VLM)。当机器人看到一张照片时,这个侦探不仅能看到“地上有个黄色的牌子”,还能瞬间理解:“哦,这是一个‘小心地滑’的警示牌,这意味着牌子周围的地面都很危险,不能走。”
- 创新点:它不需要人类提前教它什么是“湿地板”,它自己就能从图片里“推理”出规则。如果看到一排路障锥桶,它会明白:“虽然锥桶本身不挡路,但它们围起来的区域是禁区。”
2. 把“想法”变成“地图” (语义落地)
侦探发现了规则,但机器人需要具体的“禁区地图”才能执行。
- 比喻:侦探告诉机器人:“别靠近那个穿红衣服的人。”机器人需要把这个模糊的指令变成具体的坐标。CORE 会立刻在机器人的“脑海地图”上,以那个穿红衣服的人为中心,画出一个隐形的安全缓冲区。
- 操作:它把侦探的“语言规则”(比如“不要靠近”)转化成了具体的“空间禁区”(比如“距离那个人 1 米内的圆圈”)。
3. 像老司机一样“踩刹车” (安全控制)
有了禁区地图,机器人怎么动呢?
- 比喻:机器人的控制核心就像一个经验丰富的老司机。他手里有一个“刹车系统”(控制障碍函数,CBF)。
- 如果机器人想直行,但前方是“隐形禁区”,这个系统会立刻介入,温柔但坚定地调整机器人的方向或速度,确保它永远不跨进那条红线。
- 即使机器人的眼睛(传感器)有点模糊,或者 AI 侦探偶尔看走眼了,这个系统也会通过数学概率保证:只要它还在安全范围内,就不会突然失控撞上去。
为什么这个研究很重要?
- 以前的机器人:像是在走钢丝,必须有人提前把钢丝画好,并且告诉它哪里是悬崖。一旦到了没画过的新地方(比如一个从未见过的办公室),它就可能因为不懂“这里不能踩”而掉下去。
- 现在的 CORE:像是一个有常识的探险家。它走进一个陌生的房间,看到“禁止入内”的牌子,看到“有人在工作”,看到“地面湿滑”,它就能当场理解并自动避开。
实验结果怎么样?
研究人员在模拟环境和真实的机器狗(Boston Dynamics Spot)上做了测试:
- 结果:CORE 的表现几乎和拥有“上帝视角”(知道所有秘密规则)的机器人一样好。
- 对比:那些没有“常识推理”能力的旧方法,在遇到新情况时,经常因为不懂语境而做出危险动作(比如试图穿过人群或踩上湿滑地面)。CORE 成功避免了这些情况,比旧方法安全得多。
总结来说,CORE 让机器人从“只会避障的机器”进化成了“懂规矩、有常识的智能伙伴”。它不再需要人类把世界的所有规则都写进代码,而是学会了看着眼前的世界,自己思考什么该做、什么不该做,从而在复杂多变的真实世界中安全行走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。