RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models
本文介绍了 RoboSemanticBench,这是一个具身基准测试,它揭示了预训练骨干网络的语义能力与视觉-语言-动作模型(Vision-Language-Action models)的动作预测能力之间存在显著差距,因为许多策略尽管能够成功抓取,却无法根据复杂的指令语义正确选择物理目标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你有一个非常聪明的机器人助手。你教会了它阅读和理解复杂的句子,你也教会了它如何移动手臂。现代机器人的一个宏大愿景是这两项技能的融合:机器人应该根据你的话进行“思考”,并基于这种理解进行“行动”。
论文 "RoboSemanticBench" 提出了一个简单但令人不安的问题:机器人是真的在听,还是仅仅在瞎猜?
以下是他们利用日常类比得出的研究结果。
1. 设置:“积木游戏”
研究人员创建了一个名为 RoboSemanticBench (RSB) 的测试。想象一张桌子上放着几个带有字母(A, B, C, D 等)标签的彩色积木。
- 指令: 机器人会收到一个问题,比如一道数学题(“27 减 17 等于多少?”)或一个常识问题(“你在哪里洗碗?”)。
- 选项: 答案印在积木上(例如:积木 A 写着“4”,积木 B 写着“10”,积木 C 写着“11”)。
- 任务: 机器人必须阅读问题,算出正确答案,找到带有该答案的积木,然后把它捡起来。
这就像是在玩一场 “老师说” (Simon Says) 的游戏,但不同于仅仅模仿动作,机器人必须通过解谜来知道应该触摸哪个物体。
2. 问题:“聪明的大脑,笨拙的手”
研究人员测试了许多目前最先进的机器人(如 , OpenVLA 和 GR00T)。他们发现了一个奇怪的差距:
- “抓取”技能 (The "Grasp" Skill): 大多数机器人非常擅长物理性地抓取任何积木。如果你对它们说“捡起一个积木”,它们几乎能 100% 完成。
- “选择”技能 (The "Choice" Skill): 然而,当被要求根据数学或逻辑逻辑捡起正确的积木时,它们表现得很糟糕。
类比: 想象一名正在参加选择题考试的学生。
- 该学生拥有极佳的书写能力,可以物理性地圈出页面上的任何字母(抓取)。
- 但当他们需要阅读问题并决定要圈哪一个字母时,他们就是在随机猜测。他们圈中正确答案的概率并不比闭着眼睛乱指更高。
论文将此称为 “语义落地” (Semantic Grounding) 的失败。这意味着机器人的“大脑”(理解语言的部分)并没有真正与它的“手”(移动的部分)进行交流。手在移动,但它并没有遵循大脑的逻辑。
3. 证据:随机猜测
研究人员测量了两件事:
- 它抓住了积木吗?(通常是的)。
- 它抓住了正确的积木吗?(通常不是)。
当他们观察那些成功抓取了积木的机器人时,发现它们选择哪个积木的过程往往比随机猜测还要差。
- 如果有 4 个选项,随机猜测的正确率应该是 25%。
- 许多机器人的正确率甚至低于 25%。
- 这看起来就像机器人是在主动尝试把答案选错,因为它根本没有在阅读问题。
4. 为什么他们尝试修复它?(以及为什么失败了)
研究人员尝试了两种“疗法”,以观察是否能强迫机器人更好地倾听:
- 疗法 1:“先思考再行动”(推理): 他们让机器人在移动手臂之前,先用文字写出答案(例如:“27 减 17 等于 10,所以我需要积木 B”)。
- 结果: 这有一点帮助,但即使在写出正确答案后,机器人仍然经常抓错积木。这就像一个学生在草稿纸上写下了正确答案,但在试卷上却圈错了字母。
- 疗法 2:“多学习”(共同训练/Cotraining): 他们尝试在教机器人移动的同时,教它语言问题。
- 结果: 这反而让机器人变得更糟了。看来同时尝试做这两件事会让机器人的“大脑”感到困惑。
5. 结论
论文得出结论:虽然这些机器人非常擅长模仿动作(复制人类所做的动作),但它们目前不擅长利用语言技能来进行决策。
它们就像是非常出色的演员,可以完美地背诵台词,却并不理解剧本的含义。如果稍微改变一下剧本(换一个数学题),演员就会僵住或开始瞎猜,因为他们还没有学会将单词的含义与移动双手的动作联系起来。
简而言之:机器人可以捡起积木,但它们并没有在针对要捡哪块积木进行“思考”。它们只是在瞎猜。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。