A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning
本文提出了一种用于异构机器人的去中心化导航框架,该框架将基于大语言模型(LLM)的策略优化与 UCB 及 Double DQN 控制器相结合,并证明了将 LLM 推理限制在轮次级更新、同时使用局部学习进行滴答级动作处理,与其它配置相比,能显著提高目标完成率并缩短完成时间。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一支机器人团队正在试图共同解决一个谜题,但每个机器人的思考和移动速度都不同。在机器人领域,人们对使用大语言模型(即那些能够写故事或回答复杂问题的强大计算机程序)来帮助机器理解其任务产生了日益浓厚的兴趣。这些模型擅长高层级的思考,例如决定“走向门口”或“避开障碍物”。然而,它们往往反应太慢,无法做出每分之几秒就需要做一次的瞬时决策,以防止机器人撞到墙壁。这给工程师们带来了一个难题:如何利用一个聪明但迟钝的思考者来引导一个快速且具有反应能力的移动者,而不让这个迟钝的思考者阻碍进度?如果机器人每走一步都要询问计算机,整个系统就会陷入停滞。如果计算机从不说话,机器人可能会陷入循环,无法从错误中学习。
这一挑战正是北亚利桑那大学和新泽西理工大学研究人员的一项新研究的核心。他们想看看是否可以构建这样一个系统:一组不同的机器人可以在完成任务后分享彼此学到的知识,利用这些共享的智慧来改进下一轮的策略,然后让它们各自快速的局部控制器来处理实际的移动。研究人员设置了一个模拟环境,其中有三个机器人,每个机器人都配备了基于不同大语言模型的独特“大脑”。这些机器人必须在虚拟空间中导航以到达特定目标。其核心创新在于一种双层方法:一个缓慢、深思熟层的部分仅在每一轮结束后更新机器人的通用策略,而一个快速、反应层的部分则负责处理每一刻的即时移动。这些机器人并不是连接到一个中央指挥官,而是共享一个简单的数字公告板,在上面发布各自的结果和经验教训,从而使每个机器人都能根据团队的经验来完善自己的计划。
研究人员测试了四种不同的团队协作组织方式,以观察哪种效果最好。在第一种设置中,每个机器人仅依赖于自身的历史记录和一个基础的学习系统,彼此之间不进行信息共享。在第二种设置中,机器人可以阅读共享的公告板,并使用一个简单的数学规则来决定如何调整其策略,但它们仍然使用相同的基本学习系统进行移动。第三种设置完全移除了学习系统,迫使机器人直接遵循语言模型的指令,而不进行任何局部适应。最后一种最完整的设置,结合了共享公告板、策略调整规则以及一个更先进的学习系统,该系统能够关注语言模型的建议,同时仍能做出自己的快速决策。
结果显示,最完整的系统是最有效的。在模拟中,这种完整的配置使得机器人在九十次尝试中每一次都成功到达了目标。更重要的是,它也是最快的。这组机器人在 42 个刻度(模拟中的时间单位)的中位数时间内到达了目标,而那些不进行信息共享的机器人则需要 69 个刻度。完整的系统也表现出了最一致的性能,极少出现机器人完成任务时间异常过长的情况。研究人员发现,随着实验的进行,机器人的表现有了显著提升:完成任务所需的时间从前几轮的平均 57 个刻度下降到了最后几轮的仅 41 个刻度。这表明,共享信息与使用智能局部控制器的结合,使得团队能够快速学习和适应。
有趣的是,研究还揭示了仅仅拥有一个共享公告板或一个智能策略调整器本身是不够的。那些拥有共享信息但缺乏先进局部学习系统的机器人,虽然在初期具有竞争力,但随着实验的进行,它们的效率反而变慢了。这表明,分享想法是有帮助的,但前提是机器人必须拥有足够先进的局部系统,以便知道如何将这些想法应用于其即时移动。研究还指出,每个机器人所使用的特定语言模型类型并没有创造出明显的胜者;性能更多地取决于整个系统的构建方式,而非使用了哪种特定的计算机大脑。
研究人员谨慎地指出,这些结果来自计算机模拟,而非在真实房间里的物理金属机器人测试。研究中的机器人移动方式完全相同,区别仅在于它们的软件大脑和决策过程。虽然结果令人鼓舞,但作者强调,这是在受控环境下系统行为的描述,并不保证在混乱、不可预测的现实世界中也会完全相同。他们并未声称已经解决了机器人团队协作的问题,而是提供了一个清晰、可行的范例,展示了如何将高层级思考与低层级行动分离,从而让团队在共同学习的同时不至于混乱。
最终,这项研究为构建更智能的机器人团队提供了一个实用的蓝图。它表明,你不需要一个超级计算机来控制一群机器。相反,你可以赋予每个机器人自己的声音和思考方式,让他们在事后分享成功与失败,并信任他们的局部控制器来处理即时细节。通过将“慢思考”与“快行动”放在不同的轨道上,团队可以比试图同时处理所有事情时移动得更快,学习得更好。这种被研究人员称为“模式约束语言模型”(schema-bounded language model)的方法,为创建既有深度思考能力又具备敏捷性、能够适应新挑战而不失去平衡的自主系统指明了方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。