← 最新论文
💻 computer science

VisTa3D: A Dataset and Benchmark for Thin Object Reconstruction from Vision, Tactile, and 3D Point Clouds

本文介绍了 VisTa3D,这是首个包含 70 种薄型物体同步视觉、深度和触觉数据的数据集及基准测试,证明了当前的 3D 重建模型在处理薄结构方面存在困难,并提出了一种新的视觉-范围-触觉基准,旨在通过触觉反馈提高重建保真度。

原作者: Shania Guo, Yeongsik Seo, Andrew Fu, Mei Hao, Iris Xia, Jiwon Jenny Lee, Xinyi Mary Xie, Hyoungseob Park, Aaron Dollar, Alex Wong

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Shania Guo, Yeongsik Seo, Andrew Fu, Mei Hao, Iris Xia, Jiwon Jenny Lee, Xinyi Mary Xie, Hyoungseob Park, Aaron Dollar, Alex Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,仅使用一个摄像头和一个距离传感器来构建一个完美的地球三维地图。对于大多数物体,比如椅子或桌子,这种方法效果很好:摄像头捕捉形状,传感器测量距离。但有一类物体会破坏这些工具:那些极其纤细的物体,比如一根细线、一根脆弱的树枝或自行车轮的辐条。对于摄像头而言,这些物体占据的像素极少,以至于它们往往消失在背景之中。对于距离传感器而言,它们太窄了,以至于光束可能会直接从旁边滑过,或者反射信号太弱而无法被记录。结果是,即使是旨在重建三维场景的最先进计算机程序,在面对这些细长结构时也往往会完全失效,留下空隙或将它们模糊成虚无。这是机器人技术和虚拟现实领域的一个重大障碍,因为在这些领域中,理解物理世界的精细细节对于机器安全有效地进行交互至关重要。

为了解开这个谜题,耶鲁大学的一个研究小组致力于了解这些系统究竟是如何以及为何失败的,以及增加触觉是否会有所帮助。他们创建了一个名为 VisTa3D 的新数据集,这本质上是一个包含真实世界中具有细长物体的场景库,这些场景是通过多种类型的传感器同步采集的。该团队收集了 387 个不同的场景,其中包括 70 种不同的细长物体(如电线、缆绳和木制小雕像),并将其放置在从办公走廊到室外楼梯的 17 种不同环境中。在他们记录的每一个瞬间,都捕捉了一张标准的彩色照片、一张显示距离的深度图,以及一份独特的触觉响应图。这最后一部分是核心创新:他们使用了一种特殊的传感器,其作用类似于数字皮肤,通过按压物体来记录表面在压力下是如何变形的。这为计算机提供了一种直接的、局部的物体形状测量,而不受物体在照片中所占空间大小的影响。

研究人员首先通过将这一新数据输入到 11 个现有的最优秀的 3D 重建模型中,测试了当前技术的极限。结果非常显著。即使是那些能够轻松处理复杂房间和大件家具的最先进系统,在面对这些细长物体时也表现得极其吃力。当研究人员专门针对场景中的细长部分进行评估时,这些模型的准确度大幅下降。计算机根本无法确定电线在哪里或有多粗,通常会将它们视为根本不存在。这项研究证实,问题不仅在于缺乏数据,更在于这些模型在物体过小而无法从远处清晰辨识时,对视觉信息的解读存在根本性的局限。

为了解决这个问题,该团队引入了一种结合视觉、距离和触觉的新方法。他们构建了一个基准模型,该模型同时接收视觉图像、稀疏的距离数据和触觉压力图。通过向计算机输入触觉信息,他们赋予了机器一种即使在摄像头看不清时也能“感知”物体形状的方法。结果显示出明显的改进。这个被命名为 Tactile-DC 的新模型能够以比任何纯视觉系统更高的保真度重建细长结构。它成功恢复了其他方法遗失的细节,证明了触觉提供的局部信息可以填补视觉留下的空白。虽然该系统目前尚不完美,在面对某些材料和光照条件时仍面临挑战,但这项实验展示了一条可行的发展路径。通过将触觉添加到视觉工具箱中,机器或许终于能够看到这个世界的完整且细腻的细节——从最厚的墙壁到最细的电线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →