← 最新论文
💻 computer science

ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction

ReLI 是一个跨语言框架,通过使大规模基础模型能够理解自然语言指令、进行语义推理并有效地执行任务,从而使其能够适配超过 140 种多样化的语言(包括低资源语言和克里奥尔语变体),进而克服现有仅针对高资源语言系统的局限性。

原作者: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人可以理解任何语言指令的世界,从最广泛使用的语言到小规模社区使用的稀有方言。几十年来,自然的人机协作之梦一直受到一个简单障碍的阻碍:语言。虽然现代机器人正变得越来越能够感知周围环境并穿行其中,但它们在很大程度上仍被训练为只能理解少数几种主要语言,如英语或中文。这种局限性将数十亿使用其他语言、方言或克里奥尔语的用户排除在外,实际上将他们拒之于自动化未来的大门之外。人类与机器人交互领域依赖于将口头或书面请求转化为物理动作的能力,这一过程被称为“接地”(grounding)。直到现在,这种转化一直是一条单行道,仅对那些可以使用高资源语言的人有效,从而让世界其他地方的人群处于落后地位。

一组研究人员开发了一种名为 ReLI 的新系统,旨在打破这些语言壁辈。ReLI 让自主智能体能够进行自然对话、对环境进行推理,并无论指令以何种语言给出都能执行任务。该系统并不依赖于先将用户的语音翻译成英语,也不要求机器人为每种新语言进行重新训练。相反,它利用了大规模预训练计算机模型在数百种不同语言中同时理解词汇背后含义的内在能力。通过将这些语言模型与允许机器人“看见”物体和空间的视觉传感器相结合,ReLI 可以将诸如用某种稀有方言说出的“寻找红色的椅子”之类的命令,转化为精确的物理运动,而用户无需掌握任何技术代码或使用全球主流语言。

研究人员在模拟环境和使用配备了摄像头和深度传感器的轮式机器人及四足机器人的真实场景中测试了该系统。他们让机器人完成了超过 70,000 次多轮对话,涉及 140 多种不同的语言。这些语言经过精心挑选,以代表世界语言多样性的广泛光谱,包括拥有海量数字数据的资源丰富型语言、数据有限的低资源型语言,以及经常被技术忽视的脆弱语言或克里奥尔语。任务范围涵盖了从简单的单步指令(例如向前移动特定距离)到复杂的、需要机器人穿过房间、根据描述识别物体并报告所获结果的多步任务。

结果显示,该系统在如此广阔的语言图谱中表现出了卓越的一致性。在几乎所有测试的语言中,机器人都能正确理解用户的意图并执行任务,成功率超过 83%。对于许多最常见的语言,成功率甚至攀升至 97% 以上。即使对于最脆弱或资源匮乏的语言,该系统也保持了极高的准确度,能够成功解析指令并引导机器人到达目标。机器人处理指令并开始移动所需的时间保持稳定,无论指令是用主要世界语言还是稀有方言给出的,平均都在 2.1 到 2.6 秒之间。这种速度和可靠性表明,该系统不仅是一个理论概念,更是一个能够进行实时操作的实用工具。

为了确保技术的真正包容性,研究人员还开展了一项研究,让人类参与者使用其母语与机器人进行交互。三十四名精通 13 种不同语言的评分员在真实的实验室环境中测试了该系统。他们报告称,交互过程感觉自然且具有响应性,绝大多数人注意到,他们并未察觉到基于所使用语言的性能差异。这一发现至关重要,因为它表明该系统并不偏袒某种语言,也不会造成用户因语言不同而导致体验较差的隐形差距。该系统成功处理了“语码转换”(code-switching),即用户在单个句子中混合使用两种语言的情况,并且能够处理复杂的空间推理,例如导航至仅通过功能描述的位置,如“烹饪食物的地方”。

这一成就的核心在于系统如何将语言与行动联系起来。当用户说话或输入命令时,系统首先会对输入进行归一化处理,必要时将语音转换为文本,然后将其传递给充当机器人“大脑”的大型语言模型。该模型解释命令的意图,并将其分解为一系列逻辑步骤。随后,它咨询机器人的视觉传感器,以识别命令中提到的物体和空间。如果用户要求机器人去特定的椅子旁,系统会利用计算机视觉在房间内定位那把椅子,确定其在三维空间中的精确位置,并计算机器人到达该处所需的路径。最后,系统会生成一个计划,并且出于安全考虑,在执行复杂或长距离移动之前,通常会请求用户确认。整个过程无缝衔接,在无需显式翻译或针对每种新语言进行专门训练的情况下,弥合了人类思维与机器行动之间的鸿沟。

研究还探讨了这项技术的极限,揭示了虽然系统具有鲁棒性,但并非无懈可击。当机器人必须识别外观非常相似的物体,或者视觉环境过于杂乱导致难以区分目标时,会出现最显著的挑战。此外,需要进行复杂多步序列导航的任务比简单的直接指令更容易出错,原因仅仅是推理链条中出现错误的机会更多。然而,即使在这些困难场景下,系统的表现依然强劲,研究人员指出,错误通常与机器人的物理传感器限制或环境的复杂性有关,而非语言理解能力的失败。

通过证明单一框架可以高精度地处理超过 140 种语言,这项工作为人类与机器人交互开辟了一条新路径。它不再认为机器人必须学习特定语言才能发挥作用,而是转向一种机器人适应用户母语的模型。研究人员向公众发布了其数据和代码,邀请他人在此基础上进行开发。最终目标不仅是让机器人能说多种语言,而是创造一个未来——即指挥机器的能力是一项普世权利,可以由任何人在其最熟悉的语言环境下实现。这种转变承诺了自动化的民主化,确保机器人技术的益处能由全人类共享,而非仅仅服务于那些掌握数字精英语言的人群。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →