Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
本文研究了仅通过机器重构指令将希腊语引入机器人视觉-语言-动作策略的过程,揭示了稳健的评估需要空基准测试(null benchmarks)和种子复制以避免错误结论,同时证明了尽管存在对特定表述的过拟合现象,双语训练仍能带来相对于对照组的一致性提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够看、能理解且能移动的机器人正在成为现实,但它们目前只能说一种语言:英语。这些机器通过观看人类执行任务的视频来学习,而这些视频中的指令是用英语书写的。帮助它们理解这些词汇的软件是在海量的英语文本上训练出来的,这使得它们在处理这种特定语言时表现得极其出色。对于任何说希腊语或其他语言的人来说,这都造成了一个难以逾越的障碍。目前还没有关于机器人带着希腊语指令移动物体的视频库,而从头开始构建一个这样的库,需要手动引导机器人手臂完成每一次动作数月之久。研究人员提出的问题很简单:他们能否利用现有的英语数据,通过计算机将指令翻译成希腊语,并在不重建整个系统的情况下,教会机器人理解这种新语言?
事实证明,答案比简单的翻译要复杂得多。来自雅典 Sophea AI 和 KIEFER SA 的一个研究小组采用了一个开源机器人系统,并向其输入了数千条由机器生成的希腊语指令。他们没有改变机器人的大脑或其物理结构;他们只是将英语文本替换成了希腊语文本。翻译过程既快速又容易,仅耗时数小时。然而,真正的挑战在于当他们试图衡量机器人是否真的理解了它所接收到的指令时。在机器人领域,让一个系统看起来表现成功其实非常容易,即便它实际上只是在瞎猜。研究人员发现,通常给出明确“通过”或“失败”结论的标准测试完全被误导了。他们发现,即使指令是胡言乱语,或者机器人根本从未学过希腊语,它执行希腊语指令的成功率依然很高。这是因为机器人是在识别场景和物体,而不是在阅读文字。
为了解决这个问题,团队不得不发明新的测试方法。他们建立了一个对照组,故意给机器人错误的希腊语指令,以观察它是否仍会尝试执行任务。他们发现,在一个包含十项任务的小型集合中,使用机器翻译的希腊语指令进行训练的机器人似乎有百分之八十四的时间表现成功。但当他们使用错误指令进行测试时,它的成功率仍有百分之八十二左右。这证明了机器人并不是在阅读希腊语,而是在对视觉设置做出反应。机器人完全忽略了语言。
随后,研究人员尝试了另一种方法。他们使用了包含九十项任务的大型集合,在这些任务中,机器人必须在同一场景下的多个可能目标之间做出选择。在这里,语言成为了告诉机器人该做什么的唯一信号。他们发现,接受过英语和希腊语双语指令训练的机器人,遵循希腊语指令的成功率约为百分之二十七,这明显高于随机猜测的水平。然而,仅接受过希腊语训练(没有任何英语数据支持)的机器人,其表现几乎与随机猜测无异。虽然双语训练的平均表现优于仅希腊语训练,但两者的性能统计范围存在显著重叠,这意味着数据无法明确证实英语训练是否起到了必要的支架作用。最稳健的发现是,目标语言的演示是必要的,但仅靠它们往往是不够的;仅用希腊语训练的策略几乎无法遵循语言,在多次测试运行中,其表现始终处于自身失败底线的三个百分点以内。
研究还揭示了机器人并非以人类的方式学习希腊语。相反,它是在记忆机器翻译器使用的特定措辞。当研究人员使用另一个计算机程序编写的希腊语句子测试机器人时,机器人的表现大幅下降。它学习的是第一个翻译器的风格,而非语言本身。为了修复这一点,他们让机器人使用七种不同的希腊语表达方式来完成同一项任务。这一简单的改变使机器人的鲁棒性大大增强,在面对新措辞测试时,性能下降幅度减少了一半。这表明,训练数据中的多样性对于机器人超越单一机器人的写作风格进行泛化至关重要。
或许最令人惊讶的发现是,一些常识性的改进反而让机器人的表现变差了。团队尝试先用一个已经适应了希腊语的模型开始训练,认为这能给它一个领先优势。结果,机器人在英语和希腊语方面的表现都变差了。他们还尝试让负责处理语言的机器人大脑部分进行自由学习,而不是保持冻结状态。这也导致了性能下降。结果表明,对于这些特定的系统,最好的策略是保持语言理解部分的大脑与训练时完全一致,仅教机器人如何使用新的语言指令进行移动。
研究人员还尝试将这些方法应用于大规模的真实世界机器人数据,其规模远大于他们的模拟测试。他们将超过五万段真实的机器人片段翻译成了希腊语。然而,由于缺乏运行测试所需的物理机器人硬件,他们无法衡量这些数据的成功程度。这凸显了该领域的一个主要瓶颈:翻译数据既便宜又快速,但验证机器人是否真正学会了,则既缓慢又昂贵,且需要物理设备。
最终,论文得出结论:为机器人添加一种新语言是可能的,但这不仅仅是翻译那么简单。它需要一个已经理解该语言的特定基础模型,需要新语言与英语混合的训练数据,以及一个包含刻意失败测试的严谨测试过程,以确保机器人确实在倾听。机器人并不以深层的人类方式学习语言;它学习将特定的词汇模式与动作联系起来,并且需要英语训练的稳定性来支撑,尽管英语如何支持希腊语的具体机制仍是一个开放性的问题,而非已证实的规则。这项工作为该领域的其他人敲响了警钟:不要仅仅根据表面上的成功率来信任机器人,务必使用能证明机器人并非仅仅在瞎猜的对照组进行测试。通往多语言机器人的道路不仅是由数据铺就的,更是由证明数据被真正理解的严谨纪律所铺就的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。