← 最新论文
🤖 machine learning

Learning to build covering structures with continuous adjustments

本文提出了 HSAC,这是一个强化学习框架,它使机器人能够通过利用图神经网络和扩展的 Soft Actor-Critic 算法来处理混合离散-连续动作空间,从而在无需预定义规划的情况下实时生成序列,实现自适应地构建复杂结构,并成功地从仿真环境迁移到物理硬件。

原作者: Gabriel Vallat, Maryam Kamgarpour, Stefana Parascho

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Vallat, Maryam Kamgarpour, Stefana Parascho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:机器人构建复杂的结构不再是遵循僵化的、预先绘制的蓝图,而是通过在过程中“感知”路径,不断调整以应对每一次微小的晃动或缺陷。这就是机器人建筑技术的愿景——该领域旨在更高效地利用材料,并创造出人类双手或传统机器难以实现的形状。然而,一个主要的障碍一直阻碍着这一进程:现实世界是混乱的。无论计划多么精确,物理材料总会有细微的变化,机器也会产生微小的误差。在传统的建筑中,如果一个方块的位置偏差了哪怕仅仅几分之一毫米,整个计划可能就需要废弃并重新开始,或者更糟,导致结构坍塌。目前的各种方法难以适应这些不可避免的错误,因为它们依赖于无法解释物理现实之不可预测性的固定指令。

一组研究人员开发了一种让机器人学习如何建造的新方法,这种方法彻底抛弃了“总设计图”的概念。机器人不再遵循剧本,而是通过试错来学习建造,使用的是一种被称为“强化学习”的人工智能技术。在这种方法中,机器人的行为就像一名通过实践学习的学生:它尝试放置一个方块,观察结果;如果结构保持稳定,它会获得奖励;如果结构摇晃或倒塌,它则从错误中学习。研究人员专注于一个特定的挑战:两台机器人协作建造一座跨越式拱门。一台机器人负责放置方块,另一台则负责扶住自由端,以防止结构倾覆。这种设置非常微妙;结构始终处于不稳定的边缘,需要不断的、细微的调整才能保持直立。

他们发现的核心在于一种新的算法,允许机器人同时做出两种决策:选择使用哪种类型的方块,以及决定精确的放置位置。这是一个极其困难的问题,因为方块的选择与放置位置是深度关联的;对于某种类型的方块来说理想的位置,对另一种类型的方块可能就很糟糕。以往的方法试图通过简化问题或固守僵化计划来处理此类问题,但研究人员发现,这些方法往往会陷入局部最优解,无法找到最佳的建造方式。他们的新方法被称为“混合软行动者-评论家算法”(hybrid soft actor-critic algorithm),它将建造过程视为机器人与结构之间的一场持续对话。它允许机器人探索不同的可能性,不仅学习什么行得通,还学习在事情出现轻微偏差时如何恢复。

为了实现这一点,研究人员并没有将结构表示为一系列坐标,而是将其表示为一个连接网络,类似于地图显示城市之间如何通过道路相连。这种基于图(graph-based)的视角有助于机器人理解建筑的形状,无论其在空间中如何旋转或移动。该系统的一个关键创新在于一种组织信息的方式,以确保机器人关于“挑选哪个方块”的决策不会与其关于“放在哪里”的决策产生混淆。通过仔细构建信息结构,机器人可以探索大量的可能性而不至于感到不知所措,最终找到了一条其他方法未能发现的通往稳定拱门的路径。

团队首先在模拟环境中测试了他们的系统,在那里可以快速进行数千次试验。他们将新算法与现有方法进行了对比,发现其学习能力显著优于后者。旧方法经常陷入次优解的循环中,始终无法达到完美的拱形,而新系统则能一致地找到更好的建造方式。该系统还具有鲁棒性,这意味着即使研究人员更改了设置或通过增加方块类型来增加任务难度,它也能表现良好。该系统可以处理多达十种不同类型的方块而不会丧失学习能力,展示了其扩展到更复杂任务的能力。

为了证明这种学习能力可以转化为现实世界,研究人员使用两台工业机器人和一套3D打印塑料方块搭建了一个物理实验装置。他们在工作区上方放置了一个摄像头,用于追踪每一个被放置方块的位置。机器人利用摄像头的数据来更新其对结构的理解,并根据所学知识决定下一个方块的放置位置。结果是在实时环境下成功建造了一座拱门,机器人随着结构的生长不断调整其动作。当他们将这种具有适应性的现实建造过程与传统的、预先计算好整个计划的方法进行对比时,发现这种自适应方法表现得更好。由学习型机器人建造的结构能够保持其预期的形状,而预设计划的版本则由于微小且不可避免的误差而偏离了航向。

这项工作证明了机器人可以通过实时适应物理世界来学习建造复杂结构,而不是试图强迫世界去符合一个完美的计划。通过让机器人从自身的错误与成功中学习,研究人员展示了一条通往更具韧性、更高效且能应对物理世界复杂现实的建筑之路。物理实验的成功表明,这种方法最终可以应用于多种材料(从塑料到石材),创造出既美观又坚固的结构,而建造它们的机器也将理解平衡的微妙艺术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →