← 最新论文
💻 computer science

How Sampling Strategy Affects Imbalance Mitigation in LiDAR Segmentation: A Study of Structured vs. Random Point-Based Architectures

本文表明,LiDAR语义分割中类别不平衡缓解策略的有效性关键取决于点采样策略(结构化与随机)、不平衡程度以及数据采集特征之间的相互作用,揭示了逆频率加权可能会严重降低性能,而均匀加权对于结构化架构则已足够。

原作者: Antonis Savva, Christos Kyrkou, Theocharis Theocharides

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Antonis Savva, Christos Kyrkou, Theocharis Theocharides

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个自动驾驶汽车和无人机不再用眼睛,而是通过激光束进行“视觉”导航的世界。这些机器发射光脉冲,在地面、建筑物和树木之间来回反弹,并作为数百万个独立点组成的云团返回。这就是它们构建三维环境地图的方式。然而,这些地图并不完美平衡。在典型的城市场景中,激光击中广阔平坦的道路或建筑物侧面的次数,要比击中微小且遥远的街标或行人多出数千倍。这造成了严重的失衡:计算机不断地看到那些庞然大物,却几乎察觉不到那些细小而关键的细节。如果机器的大脑没有经过专门训练来处理这种情况,它可能会自信满满地忽略掉站在人行道上的行人,因为它已经被关于道路的海量数据所淹没。

几十年来,研究人员一直试图解决标准二维摄影中类似的问题,即某些物体出现的频率远低于其他物体。他们开发了各种数学技巧,迫使计算机更多地关注那些稀有项目。但当这些技巧被应用于激光点云这一混乱的三维世界时,结果却令人困惑。有些方法奏效了,而有些方法似乎让问题变得更糟。问题在于:计算机对这些激光点进行采样的方式,是否会改变哪些技巧真正有效?塞浦路斯大学和 KIOS 研究与创新卓越中心的研究人员开展了一项新研究,旨在通过在现实世界数据上测试广泛的解决方案来回答这个问题。

研究人员专注于计算机处理这些激光云的两种不同方式。第一种方法用于一种被称为 KPConv 的系统,它表现得像一位细心的测量员。它以一种结构化、有组织的方式选取点,确保场景的每个部分都按照特定的几何逻辑被采样。第二种方法用于名为 RandLA-Net 的系统,它要混乱得多;它完全是随机地抓取点,就像一个孩子在沙滩上抓起一把把沙子一样。团队针对三种截然不同的数据集测试了这两个系统:一个具有 641 比 1 极端不平衡比例的大规模城市航空扫描数据,一个具有中度不平衡程度的建筑室内扫描数据,以及一个合成的计算机生成环境。他们应用了十一种策略,以观察哪一种能最好地帮助计算机识别稀有物体。

结果给出了一个令人惊讶且明确的结论。该领域最常见的直觉——仅仅根据稀有物体的出现频率来增加其权重——结果证明是一场灾难。当研究人员使用这种标准的“逆频率”加权法时,计算机的性能显著下降,有时甚至下降了 12%。在最坏的情况下,系统会出现灾难性的失败,完全漏掉像电线杆和围栏这样的小型物体。这项研究明确排除了这种流行的做法,表明盲目提升稀有类别的权重实际上会干扰模型,并削弱其正确观察世界的能力。

相反,研究发现,最佳解决方案完全取决于计算机如何对数据进行采样。对于那种结构化、类似测量员的系统,最简单的方法往往是最好的。使用均匀加权(即对所有类别进行平等对待,而不进行任何特殊的数学调整)的表现,几乎与那些复杂的、定制化的公式一样出色。两者之间的差异极小(不到 2%),因此计算复杂权重的额外努力并无实际收益。这种结构化采样方法似乎能够自然地处理不平衡问题,以至于计算机不需要被强迫去关注稀有项目。

然而,对于那种随机、混乱的采样方法,情况则完全不同。因为这种系统丢弃了场景的自然几何结构,所以它对不平衡更加敏感。在这里,简单的均匀加面法显得力不从心,落后于专门的技术高达 4.6%。对于这类架构,研究人员发现了一种名为 LDAM 的特定损失函数(它通过调整计算机从错误中学习的方式)提供了明显的改进。即便如此,仍需保持谨慎。其他在二维摄影中表现良好的复杂公式,会导致这个随机系统像在结构化系统中那样糟糕。

研究人员还观察了学习过程的“形状”,以理解为什么会出现这些差异。他们发现,对于结构化系统,学习任务的难度与数据的失衡程度有关:数据越不平衡,学习路径就越陡峭、越困难。但对于随机系统,难度是由场景本身的物理复杂度驱动的。在充满椅子和桌子等细小物体的拥挤室内环境中,无论稀有物体有多少,学习路径都会变得崎岖不平且难以导航。这表明,随机方法之所以挣扎,是因为它失去了帮助计算机理解场景的结构化上下文。

最终,这项工作为构建这些系统的工程师提供了实用的指南。它表明,如果你使用的是结构化采样方法,请不要试图过度设计你的方案;简单、平等的类别对待是稳健且有效的。如果你使用的是随机采样方法,你确实需要一个专门的工具来处理不平衡,但你必须谨慎选择,因为错误的工具会彻底破坏整个系统。研究结论指出,在所有的 3D 视觉任务中并不存在单一的“灵丹妙药”。相反,任何解决方案的有效性,都取决于数据收集方式、计算机采样方式以及它试图理解的特定环境之间微妙的相互作用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →