VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
本文介绍了 VISOR,这是一种基于视觉 - 语言模型的测试预言机,能够自动化评估机器人任务的正确性与质量并量化不确定性,其结果表明,尽管 Gemini 和 GPT 等模型具有互补的性能优势,但它们的不确定性估计目前尚无法可靠地预测评估的正确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一支工厂里的机械臂舰队,而你的工作是确保它们正确执行任务。在过去,检查机器人是否干得好,就像让一位人类评委坐在屏幕前,观看机器人工作的每一段视频。如果机器人打翻了杯子或错过了目标,人类就得说“失败”;如果它完成了任务,就说“通过”。
这种方式既缓慢又昂贵,而且人类会感到疲惫或厌倦,导致评判标准不一致。有时一个人认为某项任务“做得好”,而另一个人则认为“还可以”。这在科技界被称为“测试预言机问题”——即弄清楚究竟由谁或什么来决定软件(或机器人)是否通过了测试。
这篇论文的作者 VISOR 尝试通过聘请一种新型评委来解决这个问题:一种能够看和读的 AI。
新评委:“视觉 - 语言”模型
把这些 AI 模型(如 GPT 和 Gemini)想象成超级聪明的学生,它们阅读了数百万本书,观看了数百万段视频。它们不仅能理解机械臂抓取橙子时发生了什么,还能理解完成得有多好。
VISOR 不再让人类观看视频,而是将视频输入给 AI,并提出两个问题:
- 它成功了吗?(成功还是失败?)
- 它完成得有多好?(高质量、中等质量还是低质量?)
随后,AI 会输出一段 JSON 代码(一种简单的计算机格式),标明“成功”或“失败”,或者给出质量评级。
实验:一场大型视频马拉松
为了检验这位新 AI 评委是否可靠,研究人员设计了一场大规模测试。他们使用模拟器(一个虚拟机器人世界)生成了超过 1,000 段视频,展示机器人执行四项不同任务,例如抓取物体、将其放入篮子,或将其移动到目标附近。
他们使用了两位不同的"AI 评委”:
- Gemini:“召回率”冠军。这位评委非常渴望捕捉错误。它很少漏掉失败案例,但有时机器人其实做得很好,它却会大喊“狼来了”(误报)。
- GPT:“精确率”冠军。这位评委非常严格。如果它说“成功”,那基本可以肯定是成功了。但它有时会漏掉细微的失败,误以为任务完成得不错,而实际上并非如此。
结果:单独使用任何一位评委都不完美。Gemini 捕捉到了更多错误,但误报也更多;GPT 在发声时非常准确,却漏掉了一些错误。论文建议,如果将两者结合使用(就像评委团投票一样),或许能兼得两者的优势。
“置信度”陷阱
这里有个转折:研究人员还问了 AI:“你有多确定?”他们测量了 AI 的“不确定性”(即其自信心的动摇程度)。
他们原本预期,当 AI 出错时,它会感到“不确定”或“紧张”。他们希望 AI 会说:“我不 100% 确定这个机器人失败了”,从而给出一个线索,提示答案可能错了。
但这并没有发生。
AI 表现得过度自信。即使它犯了错,它也有 99% 的把握认为自己是对的。这就像一个学生答错了考题,却充满自信地举手,坚持认为自己正确。论文发现,AI 的“置信度分数”并不能很好地预测它实际上是对是错。你不能仅仅因为 AI 说“我很确定!”就信任它。
核心结论
- 有效之处:利用 AI 观看机器人视频是一种快速、可扩展的方式来检查机器人是否在执行任务。这比雇佣人类观看每一段视频要便宜得多。
- 无效之处:你不能依赖 AI 的“置信度”来判断它是否犯了错。即使出错时,它也常常表现得非常确定。
- 局限性:这项测试是在模拟器(一个视频游戏世界)中进行的,而非真实的物理机器人。作者警告,现实世界中的机器人可能会有杂乱的摄像头或模糊的视频,这可能会比干净的模拟视频更让 AI 感到困惑。
简而言之,VISOR 是一个有前途的工具,可以作为机器人不知疲倦的自动化主管,但需要谨慎使用。它擅长把握大局,但即使出错时也可能固执地自信,因此人类仍需密切关注整体情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。