← 最新论文
🤖 AI

Advancing DialNav through Automatic Embodied Dialog Augmentation

为了克服限制 DialNav 框架的数据稀缺问题,本文引入了 RAINbow 数据集——一个包含 23.8 万个自动生成的对话回合的大规模集合——以及双策略训练和定位模型,这些共同作用使模型在已见和未见导航划分上均实现了显著的成功率提升,并达到了新的最先进性能。

原作者: Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座巨大且混乱的豪宅中寻找一间特定的房间,但你看不见完整的地图。你有一个朋友(向导),他站在阳台上俯瞰整座房子,但他看不见你。而你(导航员)则在走廊里穿行,手里拿着一个模糊的线索,比如:“去找那间有植物的房间。”

这就是 DialNav 的世界——在这个任务中,机器人代理必须通过与远程朋友聊天来引导自己穿越一个写实感极强的房屋。问题在于,要教会机器人进行这种有帮助的对话极其困难,因为这需要海量的“练习课”(数据)。原始研究人员只有大约 2,000 次练习课,这就像是试图通过只看几局棋的过程来学习如何下国际象棋。

这篇论文介绍了一种新的方法,通过三个妙招来教会机器人通过交谈进行导航:

1. “食谱重组” (RAINbow 数据集)

最大的障碍是缺乏练习数据。收集新数据的成本很高;雇佣两个人扮演虚拟房屋中的导航对话需要花费数千美元。

作者提出了一个聪明的、低成本的解决方案:RAINbow 数据集

  • 类比: 想象你有一个存放着旧的、单页指令的图书馆,比如“去厨房,然后左转”。这些指令枯燥且简短。作者将这些旧的指令缝合在一起,变成了长而曲折的路径。
  • 魔力所在: 然后他们使用了一个人工智能(大语言模型)将这些缝合后的路径改写成自然的对话。与其让机器人只说“左转”,AI 会让导航员说:“我在一个有着奇怪画作的走廊里,我该往哪走?”而向导会回答:“啊,绕过那幅画向右转。”
  • 结果: 他们用极低的成本,将一个微小的 2,000 次会话库变成了一个庞大的 238,000 次会话库。这就像是拿一本单一的食谱,利用机器生成了 10 万份全新的、独特的食谱。

2. “教官与探险家” (双策略训练)

拥有巨大的练习数据库固然很好,但如果你用旧的方法来教机器人,它会失败。旧的方法就像是一个只通过完美模仿老师的手势来学习的学生。如果学生犯了一个微小的错误,他们就会迷失方向且无法恢复。

作者引入了 双策略训练 (Dual-Strategy Training),这就像同时用两种不同的方式训练一名运动员:

  • 教官 (数据引导型): 机器人遵循数据集中的精确路径,学习“正确”的答案以及在何时寻求帮助。
  • 探险家 (策略内探索型): 机器人被允许偏离路径并犯错。当它迷路时,它必须学会如何通过与向导的聊天来回到正轨。
  • 为什么有效: 这不仅教会了机器人该做什么,还教会了它在出错时如何恢复。这区别于那种一旦撞到墙就会崩溃的机器人,与那种会说“哎呀,我迷路了,让我问问路”并继续前进的机器人。

3. “福尔摩斯” (更好的定位能力)

在这个游戏中,向导对导航员的位置是盲目的。当导航员说“我在一个有蓝色沙发房间里”时,向导必须猜测:“噢,那一定是二楼的客厅。”这被称为定位 (Localization)

原有的系统在猜测方面表现不佳。作者通过借鉴另一种类型的导航训练(VLN)中的知识,升级了向导的大脑。

  • 类比: 这就像是把一个擅长解决某座城市犯罪案件的侦探,通过展示另一座城市的地图,来教他熟悉一座新城市的布局。向导变得更加擅长根据导航员的描述精准定位,从而提供了更准确的指令。

最终得分

通过结合这三点——海量的、廉价的 AI 生成练习数据教会机器人从错误中恢复的训练,以及一个能更好地猜测位置的聪明向导——机器人的表现大幅飙升。

  • 之前: 在熟悉的房屋中,机器人的成功率约为 31%;在陌生的、未见过的房屋中为 15%
  • 之后: 采用新系统后,在熟悉房屋中的成功率跃升至 58%,在陌生房屋中达到了 29%

简单来说,他们不仅仅是让机器人变得好了一点点,而是通过给它一个庞大的练习对话库,并教会它如何在不惊慌的情况下处理迷路,从而使成功率翻倍。这刷新了机器人通过交谈进行导航的表现纪录。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →