Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interactio
本文介绍了 Athena-Brain-8B,这是一个拥有 80 亿参数的端侧机器人大脑,它利用多阶段后训练流水线,成功地将强大的通用智能与专门的具身交互能力相结合,在保持与更大型模型相当的通用推理性能及更简洁回答的同时,在具身基准测试中超越了规模更大的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:机器人不再是仅仅遵循严格的“如果……那么……”指令的笨拙机器,而是能够理解凌乱的房间、制定计划并在工作时与你聊天的聪明伙伴。这就是“具身智能”(embodied intelligence)的梦想——赋予机器人一个能够在现实世界中思考和行动的大脑。长期以来,科学家们面临着一个棘手的选择:是使用一个博学多才但太慢、太重而无法装进机器人的巨大超级大脑,还是使用一个能快速移动但过于愚笨、无法理解复杂指令的微型大脑。这就像是在尝试选择:是一个需要花一小时才能找到一页内容的图书馆,还是一个可以装在手里但只有寥寥数行笔记的小型笔记本。核心问题在于:我们能否构建一个既能装在设备上,又能像人类一样进行推理,且速度快到足以跟上实时对话的机器人大脑?
于是有了 Athena-Brain-8B,由 XPENG Robotics 开发的一种新型“机器人大脑”,它试图解开这个谜题。可以将它想象成一个紧凑的 80 亿参数语言模型(一种能够理解并生成文本的 AI),专门设计用于运行在机器人自身的计算机上,而不是依赖庞大的云端服务器。研究人员不仅仅是把一个巨大的模型缩小,而是利用一种特殊的训练配方从头开始构建了一个全新的模型。他们以一个聪明的基座模型为基础,教会它高效推理,然后给它进行了一场“具身”技能的强化训练——学习如何在虚拟博物馆或超市中导航、捡起物品以及逐步解决问题。结果如何?该模型处理复杂推理任务的能力与规模更大、速度更慢的模型不相上下,但它使用的词汇更少,速度也更快。这证明了你并不需要一台超级计算机来拥有一台智能机器人;你只需要正确的训练方法,让一个小巧的大脑能够高效且快速地运转。
问题所在:“太大”与“太小”的机器人大脑
想象一下,你想制造一个机器人管家。你有两个大脑选项。选项 A 是一个庞大的超级计算机大脑。它极其聪明,了解整个互联网,并且能解决复杂的数学问题。但它太重、太慢,必须插在墙上的电源插座上,而且在回答像“我的钥匙在哪儿?”这样简单的问题时需要很长时间。选项 B 是一个微型、轻量化的大脑。它很快,可以直接装在机器人的头上,但不太聪明。如果你要求它规划一条穿过拥挤商店的路线,或者弄清楚如何修理漏水的水龙头,它可能会感到困惑。
长期以来,科学家们认为你必须二选一。你要么拥有一个无法移动的聪明机器人,要么拥有一个无法思考的快速机器人。但 Athena-Brain-8B 背后的团队提出了疑问:如果我们能教会一个小大脑同时具备聪明和快速这两个特性呢?
解决方案:四步训练营
研究人员并没有凭空猜测;他们构建了一个特定的训练流水线,就像是为机器人大脑准备的一个四步训练营。
第 1 步:通用知识库(通用 SFT)
首先,他们采用了一个标准的、聪明的语言模型(“基座”模型),并给了它大量的课外作业。这不仅仅是关于记忆事实,更是关于学习如何遵循指令、解决数学问题、编写代码以及理解世界。你可以把它想象成送机器人去上一所普通的学校,接受基础学科的全面教育。
第 2 步:学习简洁表达(通用强化学习)
这里变得非常有趣。团队意识到,聪明的机器人往往说话太多。如果你要求机器人找钥匙,而它在说出“我找到了”之前先在心里思考了 500 个字,那对于真实的机器人来说就太慢了。因此,他们使用了一种称为“强化学习”的技术。想象一位老师,不仅因为正确答案而给予金星,还因为“最短的正确答案”而给予金星。机器人因为能正确解决问题且使用的词汇更少而获得奖励。这教会了大脑变得高效,去掉了“废话”,直奔主题。
第 3 步:“现实世界”模拟(具身专家训练)
现在,大脑已经变得聪明且高效,但它从未真正“做过”任何事。它知道什么是“博物馆”,但不知道如何穿过一个博物馆。研究人员创建了两个虚拟世界:博物馆和超市。
- 在博物馆中,机器人必须引导一名游客前往恐龙化石。它必须阅读指示牌,决定转向的方向,并检查自己是否处于正确的位置。
- 在超市中,它必须找到一瓶牛奶,将其放入购物车,并完成结账。
机器人不仅仅是阅读这些任务;它在反复练习。它学会了如果尝试拿起一个瓶子失败了,应该尝试不同的角度,而不是放弃。它学会了规划路线、处理错误并坚持下去。这被称为“具身”训练,因为机器人正在学习如何与物理环境进行交互(即使这个环境是模拟的)。
第 4 步:大脑融合(模型合并)
在完成所有这些训练后,研究人员拥有了几个不同版本的脑:一个擅长通用知识,一个擅长简洁表达,还有一个擅长在博物馆和超市中导航。他们没有只选择其中之一,而是使用了一种特殊的数学技巧将它们全部“合并”成一个超级大脑。这就像是将一位学者、一位速读专家和一位探险家的最佳特质结合在一起,并塑造成一个能完美胜任这三项工作的个体。
他们的发现:小而强大
实验结果令人印象深刻。当测试 Athena-Brain-8B 时,他们发现它处理通用推理任务(如数学和逻辑)的能力与许多更大、更慢的模型一样出色。但真正的魔力在于速度和效率。
- 它说话更精炼: 与其他通过长时间“思考”来输出内容的聪明模型相比,Athena-Brain-8B 生成的响应明显更短。它不会浪费时间闲扯;它直接采取行动。
- 它行动更出色: 在虚拟博物馆和超市中,Athena-Brain-8B 完成任务的能力远优于其他小型机器人。事实上,它的表现非常出色,甚至击败了一些规模更大、功能更强的巨型昂贵模型。
- 它非常高效: 团队测量了模型完成一项工作所使用的“Token”(词块)数量。Athena-Brain-8B 使用最少的 Token 获得了最高的评分。这意味着它不仅聪明,而且具有极高的能量效率,这对于依靠电池运行的机器人至关重要。
这为什么重要
这篇论文表明,我们不需要构建庞大的、依赖云端的脑,也能拥有智能机器人。通过训练一个紧凑的模型使其变得高效,并让它在真实的、交互式的环境中进行练习,我们可以创造出一种可以运行在设备本身的“机器人大脑”。这意味着机器人可以更快、响应更及时,并且能够在互联网连接缓慢或不存在的地方工作。
研究人员展示了一个小模型(80 亿参数)可以同时学习成为一个“通才”(在许多方面都很聪明)和一个“专才”(擅长移动和行动)。他们不仅仅是制造了一个会说话的机器人;他们制造了一个能够“做事”、能够思考下一步该做什么并迅速执行的机器人。虽然要将这些机器人投入现实世界仍有许多工作要做(例如处理更复杂的物理对象),但这项研究表明,通往智能、设备端机器人的道路比我们想象的要清晰得多。机器人的未来可能不在于构建更大的大脑,而在于教导小巧的大脑变得极其高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。