← 最新论文
🤖 AI

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II 通过量化仿真与实机试验中的导航、操控及全身控制性能,将其前身统一评估框架的范畴扩展至具身智能层,从而建立了一个通过共享追踪标识来弥合仿真与现实差距的连续且面向修复的诊断流水线。

原作者: Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

物理人工智能领域致力于构建能够通过现实世界移动的机器,而不仅仅是停留在计算机内部进行思考。为了实现这一目标,工程师们将不同的智能层层堆叠在一起。在最顶端是一个推理层,就像一个能够理解语言并规划复杂任务的大脑。在下方是技能层,负责处理特定的动作,例如走向门口或拿起杯子。在最底层是控制层,负责管理机器人的肌肉和关节,以保持平衡。多年来,科学家们已经能够利用标准测试和共享数据,非常精确地测试顶层的推理层。然而,测试那些真正接触物理世界的底层部分却要困难得多。每个实验室通常都会构建自己独特的测试场,使用不同的机器人和不同的规则,这使得很难比较结果,也难以确定机器人离开实验室后是否真的能正常工作。

XPENG Robotics(小鹏机器人)的一个团队通过创造一种统一的方式来测试这些底层,解决了这种碎片化问题,从而弥合了计算机模拟与现实世界硬件之间的鸿沟。他们的新报告《DeepInsight II》引入了一个系统,该系统允许研究人员在虚拟机器人和物理机器人上运行完全相同的测试,将两者都视为同一个连续实验的一部分。他们并没有构建一种新型机器人或一种新算法,而是制造了一个更好的“度量衡”。这个系统将推理大脑、技能层和物理控制器连接成一个凝聚的整体,使他们能够追踪从机器人绊倒在地的那一刻起,一直追溯到导致这次踉跄的具体决策。

研究人员首先测试了他们的系统在多大程度上能复现现有的导航和操作基准。他们采用了已发布的机器人大脑版本,并针对标准任务进行了测试,例如遵循指令在房屋中行走或在模拟厨房中拿起物体。结果显示,他们的统一系统能够高精度地复现这些标准测试的分数,证明了他们的新度量衡并没有扭曲数据。这是至关重要的第一步,确认了这一新基础设施可以在不破坏原始测试规则的情况下,处理不同机器人设计和软件版本的复杂且混乱的现实情况。

接下来,团队将注意力转向机器人的全身控制——即负责让机器保持直立并平稳移动的层面。他们从不同的研究小组中收集了四种不同的控制系统,并在高保真模拟中通过了一套标准化的运动任务。他们发现,虽然所有系统都能执行任务,但有些系统在避免跌倒和保持精确运动方面明显优于其他系统。其中一个系统表现尤为突出,它成功完成了几乎所有的动作,并保持了极高的精度。这一模拟阶段使他们能够在冒险测试物理机器之前,快速且安全地筛选掉较弱的候选方案。

最显著的飞跃发生在他们将这些合格的系统从电脑屏幕转移到真实机器人的过程中。他们选择了同一控制系统的两个版本,并进行了匹配试验,即虚拟机器人在尝试相同动作的同时,物理机器人也在进行相同的动作。通过将这两次运行关联在同一个身份之下,他们可以直接比较结果。他们发现,虽然物理机器人的误差略多于虚拟机器人,但系统的排名保持不变。在模拟中表现最好的系统,在真实的地面上也表现最好。这证实了只要测试条件受到严格控制,模拟就是现实性能的可靠预测器。

除了衡量成功,研究人员还开发了一种诊断机器人为何失败的方法。当机器人绊倒或掉落物体时,通常很难弄清楚错误是源于错误的计划、笨拙的动作,还是对环境的误解。该团队创建了一个诊断工具,将失败分解为特定的类别。他们发现,有些失败是因为机器人的不同层之间“语言不通”;例如,导航层可能在到达某个位置时停止,但问候层要求机器人必须面向特定方向,而第一层忽略了这个细节。另一些失败则是由于机器人无论计划多么完美,在物理上都无法移动到所需的位置。

通过将这种诊断工具应用于模拟和现实运行,该团队展示了他们能够精准定位失败的确切原因。在一个真实的案例中,机器人未能完成问候,因为它内部的地图发生了轻微漂移,导致它停在了够不到人的地方。诊断系统将此识别为边界错误,即机器人对“到达”的定义与物理现实情况不符。这种细致程度使得工程师可以修复导致故障的具体接口或规则,而不是去猜测机器人哪一部分需要重建。

这项工作表明,缩小模拟与现实之间差距的方法,不在于制造更好的模拟,而在于创造一种共同的评估语言。通过将虚拟世界和物理世界视为同一个实验的两个分支,研究人员证明了他们可以将同样的测试从计算机转移到真实机器人,而不会失去比较结果的能力。这种方法并不能解决机器人领域的所有问题,但它提供了一种清晰、可靠的方式来衡量进展,并理解机器人究竟在哪里以及为什么失败。它将复杂、不透明的机器人测试过程变成了一个透明、可追溯的过程,让工程师们有信心将他们的创造物从实验室推向现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →