← 最新论文
💻 computer science

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

本文介绍了 GigaBrain-0.7,这是一种具身基础模型,它利用了一种新颖的三系统架构,并在超过 37,000 小时的异构数据上进行了训练,使其在多种机器人形态上的零样本泛化能力、指令遵循能力和任务成功率均优于先前的最先进模型。

原作者: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo
发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:一个机器人可以观察杂乱的厨房桌面,理解“把红苹果放进碗里”的口头指令,然后能够精准地计算出移动手臂的方式,而不撞倒任何东西。这就是具身人工智能(Embodied AI)的承诺:机器不仅能处理信息,还能与物理世界进行交互。多年来,研究人员一直试图通过向机器人展示成千上上万段人类双手操作物体的视频来教导它们,希望机器能借此学习物理规则和因果关系。然而,一个主要的障碍始终存在。机器人的构造各不相同;有的有两个手臂,有的只有一个抓取器,还有的靠轮子移动。从一种类型的机器人身上收集的数据往往会干扰另一种机器人。此外,仅仅观看视频并不能教会机器在犯错时如何预测下一步会发生什么,或者在任务出错时如何恢复。问题在于,我们能否构建一个单一的、聪明的“大脑”,它既能理解语言,又能观察世界,并能控制任何类型的机器人躯体,同时还能从海量的不同经验中学习。

现在,一个研究团队展示了一个重大的进展,他们提出了一个名为 GigaBrain-0.7 的系统。这不仅仅是一个单一的程序,而是一个旨在处理现实世界交互复杂性的协调系统。研究人员并没有试图强迫机器人通过一次混乱的爆发来学习所有知识,而是将学习过程组织成了三个既独立又相互关联的部分。第一部分充当“手和反射”,负责直接控制机器人的电机以执行动作。第二部分充当“规划者和观察者”,负责观察场景、理解语言指令,并将一个大目标(如“清理桌面”)分解为更小、更易管理的步骤(如“拿起杯子”并“将其移至水槽”)。第三部分是最具创新性的补充:它充当“预测者和评判者”。它会想象如果机器人继续当前的路径,场景在几秒钟后会是什么样子,并为那个未来评分,以决定机器人是在取得进展还是正在走向失败。

为了训练这个系统,研究人员并没有依赖单一的数据源。他们收集了一个包含超过 37,000 小时经验的海量库。这个集合包括了真实机器人在工厂和家庭中工作的视频、从第一视角记录的人手操作物体的录像,以及由计算机模拟生成的数据。他们还利用人工智能创建了新的训练场景,有效地扩展了机器人可以学习的情境多样性。通过将这种多样化的数据混合输入系统,研究人员让模型学习到了运动和交互的一般原理,而不是仅仅死记硬背针对某种特定机器人的特定技巧。该系统被训练用于处理 16 种不同类型的机器人躯体,从双臂机器到类人形态,教会它根据所控制的具体躯体来调整对“左”与“右”或“抓取”与“释放”的理解。

研究人员在工业和家庭环境中的真实机器人上测试了这种方法的成果。当被要求执行从未见过的任务时,该系统展现出了卓越的泛化能力。在一项测试中,机器人被要求折叠一件被扔在乱堆里的衣服,这项任务要求机器在织物移动和变形时不断调整抓取力度。在不需要针对那件特定衬衫进行重新训练的情况下,系统成功操纵了这个可变形物体。在另一个场景中,机器人被要求从一堆混合餐具中拿起一把特定颜色的勺子,这证明了它能够理解微妙的语言指令并将其应用于新物体。该系统还证明了其处理长序列动作的能力,例如整理书桌或清扫米粒,在这种情况下,机器人必须在执行许多微小动作的同时,保持对整体目标的感知。

一个关键发现是,系统预测未来并评估自身进展的能力带来了实质性的成功率提升。当研究人员移除系统的预测部分时,机器人在处理复杂任务时表现得更加吃力,经常陷入重复动作的循环,或无法从轻微错误中恢复。在预测组件激活的状态下,机器人能够预见到某种动作会导致碰撞或掉落,并在错误发生前调整航向。这种能力使得机器人能够以比以往模型更高的可靠性完成诸如包装礼物或分类方块等困难任务。研究人员发现,随着训练数据量的增加,机器人的性能持续提升,这表明系统确实是从海量且多样化的经验中真正学习到了知识。

研究还强调了不同类型数据组合方式的重要性。当系统从真实机器人实验、人类演示和模拟环境的混合数据中学习时,表现最为出色。每种来源都提供了不同类型的教训:真实机器人教会了系统关于特定机器人的物理约束,人类视频展示了人们如何自然地与物体互动,而模拟环境则让机器人能够安全地练习罕见或危险的情景。通过融合这些来源,系统开发出了对世界运作方式的鲁棒理解,这种理解可以应用于不同的机器人躯体。研究人员指出,虽然该系统并不完美,在处理某些最复杂的物理交互时仍有困难,但它代表了一种转变——即从构建执行单一任务的专用机器人,转向创建能够适应新挑战的通用智能。

最终,GigaBrain-0.7 证明了通过扩大训练数据的规模和多样性,结合将规划、行动和预测分离的结构化架构,可以使机器人变得更加强大且具有适应性。该系统不仅仅是在遵循脚本;它理解任务的上下文,预见行动的后果,并从自身的经验中学习以不断改进。尽管在实现能够处理家中或工厂中所有可能情况的系统之前仍有大量工作要做,但这项研究提供了一条清晰的前行路径。它表明,机器人技术的未来不仅在于构建更好的硬件,更在于创造更聪明、更灵活的软件,使其能够从物理世界广阔而多样的经验中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →