← 最新论文
🤖 machine learning

Trinity: Unifying Class-Agnostic Terrain and Semantic Segmentation for Unstructured Outdoor Environments by Leveraging Synthetic Data

本文介绍了 Trinity,这是一种基于 Transformer 的架构,它利用新的合成数据集(RUGDSynth)和真实世界标注数据集(EXTerra),将特定类别的语义分割与类别无关的地形分割统一起来,以实现面向非结构化户外环境的机器人无关的地形理解。

原作者: Marcus G Müller, Wout Boerdijk, Maximilian Durner, Riccardo Giubilato, Abel Gawel, Wolfgang Stürzl, Roland Siegwart, Rudolph Triebel

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Marcus G Müller, Wout Boerdijk, Maximilian Durner, Riccardo Giubilato, Abel Gawel, Wolfgang Stürzl, Roland Siegwart, Rudolph Triebel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人试图穿越一片狂野、杂乱的森林。为了从 A 点到达 B 点,它需要同时以两种截然不同的方式理解地面。

问题:“一刀切”却“无一适用”的困境
当前的机器人视觉系统就像僵硬的规则手册。

  1. “标注者”方法:某些系统只寻找特定的、有名称的物体,如“树”、“岩石”或“栅栏”。但在野外,地面并非物品的清单;它是泥土、沙子和草混合交融的产物。如果机器人看到一片看起来像沙子的泥地,僵硬的标注者可能会感到困惑,因为它不符合预先写好的类别。
  2. “可通行性”方法:其他系统试图判断地面是“可通行”还是“不可通行”。但这就像问一个只对特定某个人才有意义的问题。一条土路对卡车来说很容易,但对自行车来说却不可能通行。如果你训练机器人了解适合其自身特定轮子的可通行性,那么这种知识无法转移到拥有不同轮子或腿部的不同机器人身上。

结果呢?每次你更换机器人或环境,都必须从头开始,收集新数据并重新从零训练机器人。

解决方案:“三位一体”(Trinity)
作者提出了一种名为Trinity的新系统。将 Trinity 想象为一个同时戴着两副眼镜的机器人大脑:

  1. “特定”眼镜(类别特定):这副眼镜寻找对任务至关重要的有名称物体,如“岩石”、“树”或“栅栏”。这就像一位图书管理员,确切知道“小说”和“历史”区域在哪里。
  2. “通用”眼镜(类别无关):这副眼镜忽略名称,只关注纹理和颜色。它根据外观而非名称,将地面划分为视觉区块。这就像一位画家,看到一片“棕色粗糙的东西”和一片“绿色柔软的东西”,而无需知道它们在技术上是否属于“泥土”或“草”。这种视角是通用的;它对卡车、无人机或漫游车都有效,因为它仅仅描述眼睛所见。

秘诀:合成训练
在现实世界中训练机器人做到这一点是一场噩梦。你必须派人进入泥泞的田野,在照片上绘制数千条线,标注每一块地面。这既缓慢、昂贵,又枯燥。

为了解决这个问题,团队构建了一个虚拟游乐场(使用名为 OAISYS 的模拟器)。他们创建了一个庞大的虚假户外世界库,其中充满了数字树木、岩石以及 200 多种不同的地面纹理。他们称此数据集为RUGDSynth

  • 类比:想象训练一名飞行员。与其让一架真飞机坠毁 10,000 次来学习如何降落,不如让他们进入飞行模拟器。模拟器可以瞬间生成无限不同的天气条件和跑道。Trinity 正是在这个数字沙盒中学习了它的“地面感知”,学会了识别视觉模式,而无需人类标注每一个像素。

结果:一种新型地图
团队在真实世界数据上测试了 Trinity,包括一个行星探索实验室(一个模拟的火星环境)。

  • 结果:Trinity 成功地将世界一次性划分为“命名物体”(如栅栏)和“视觉地形区块”(如崎岖多石区域)。
  • 对比:他们将 Trinity 与其他顶级系统进行了比较。当地面看起来模糊或边界不明确时,其他系统挣扎不前,而 Trinity 则保持冷静,即使不知道具体名称,也能正确识别地面的视觉纹理。

简而言之
Trinity 是一个机器人视觉系统,它不再试图将混乱、自然的现实世界强行塞入僵硬的类别列表中。相反,它学会以两层视角观察世界:重要的物体(如树木)和地面的视觉纹理(如粗糙或平滑)。通过在庞大的计算机生成世界中进行预先训练,它学会了如此深入地理解地形,以至于可以被不同的机器人在不同的地方使用,而无需每次都重新教导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →