← 最新论文
💻 computer science

MESH for Incremental Digital-physical system (MESH4ID): A Headset-Centred Virtual Reality Pipeline

本文介绍了 MESH4ID,这是一个基于 Unity/OpenXR 构建的以头显为中心的虚拟现实流水线,它使用户能够在沉浸式 VR 环境中通过将实时 LiDAR 流冻结为可追溯的快照,从而实现室内环境的捕获、管理与重建,并进行交互式检查和按需网格生成。

原作者: Simone Cantarelli, Daniela Francia, Gian Maria Santi, Alfredo Liverani

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Simone Cantarelli, Daniela Francia, Gian Maria Santi, Alfredo Liverani

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正拿着一部神奇的相机,它捕捉的不只是你所看到的景象,而是捕捉了你周围空间的真实“形状”,将空气和家具转化成一团由微小、发光的点组成的云团。这就是 3D 扫描的世界——在这个领域,科学家和工程师们正试图教会计算机如何像人类眼睛一样,“看见”三维的物理世界。通常情况下,这需要只有在高科技实验室中才能见到的昂贵且沉重的设备。但最近,廉价传感器的出现使得这种“魔法”可以装进你的口袋,甚至戴在你的头上。然而,巨大的挑战不仅在于拍摄照片,更在于如何将那数百万个散乱的点转化为一个坚实、光滑的墙壁或桌面,让你可以在视频游戏或虚拟现实世界中穿行其中。这就像是用沙子建造城堡:如果你只是任由风吹沙动,只会得到一团乱麻。你需要一种方法来压实它、抹平它,并确保每一块砖都在正确的位置上,然后才能宣布城堡完工。

这正是来自博洛尼亚大学的一个研究小组决定解决的问题。他们创建了一个名为 MESH4ID(用于增量数字物理系统的 MESH)的新系统。他们没有让计算机在你在周围走动时自动尝试构建一个完美的 3D 模型(因为这往往会导致混乱和错误),而是构建了一个“以头显为中心”的工作流。把它想象成一个虚拟现实工作坊,而你,用户,就是现场领班。你戴着一个特殊的头显(Meta Quest 3),前面绑着一个激光扫描仪(Intel RealSense L515)。当你移动时,扫描仪会用一团实时漂浮的彩色点云为房间“绘画”。但转折点在于:计算机并不会立即尝试将这些点粘合在一起形成一面墙。相反,你决定何时“冻结”一个点的快照、保存它,然后使用虚拟工具清理这些杂乱的数据、合并不同的视角,直到你准备好时,再要求计算机构建最终的光滑表面。

研究人员发现,这种“慢慢来”的方法效果出奇地好。通过让用户来策划数据——决定哪些快照是好的、哪些应该丢弃、以及如何组合它们——他们可以在头显内创建精确的 3D 模型。他们的实验表明,虽然保存和清理数据只需要几秒钟,但最难的部分是将许多不同的快照合并在一起,这可能需要更长的时间(对于三个照片的小型集合,大约需要 12 秒)。然而,一旦数据合并完成,将其转化为坚实的 3D 网格是非常快速的。论文指出,只要你愿意成为自己 3D 电影的积极导演,这种方法就是一种实用且可靠的方式,可以在无需超级计算机或专家团队的情况下捕捉室内空间。

神奇的头显与“绘画”过程

那么,这究竟是如何运作的呢?想象一下,你戴着一个前面有一个高科技微型激光“眼睛”的 VR 头显。这个被称为 LiDAR 的激光会射出看不见的射线,以测量物体的距离。当你绕着房间走动时,头显会将世界呈现为一个实时变化的、由数百万个彩色点组成的云团。如果你看向一把椅子,你会看到一个形状像椅子的点云;如果你看向一面墙,你会看到一片平坦的点片。

在许多旧系统中,计算机试图在实时过程中将它看到的每一个点都粘合成一个巨大的、完美的 3D 模型。本文作者认为,这有点像在面糊还在搅拌时就试图烤蛋糕;既混乱又容易出错。相反,MESH4ID 将实时视图视为一个“预览”。这就像画家看着画布,观察光线照射的位置,然后决定:“好吧,那部分看起来不错,我现在把它拍下来。”

当你按下虚拟世界中的按钮时,系统会“冻结”当前的点云。它捕捉那个稍纵即逝的瞬间,并将其保存为一个永久文件。这就像是在雪花融化之前拍下一张快照。系统以两种方式保存这个快照:一种是任何人都能阅读的简单文本列表 (CSV),另一种是计算机稍后可以用来重新绘制这些点的紧凑 3D 文件 (PLY)。这至关重要,因为这意味着你拥有了每一份数据的“收据”。如果最终的 3D 模型看起来很奇怪,你可以回溯并检查到底是哪一个快照出了问题。

虚拟工作坊:清理与合并

一旦你拍摄了一些快照,你就进入了“工作坊”阶段。这是该系统大放异彩的地方。在虚拟现实环境中,你可以看到所有保存的快照像幽灵般的云团一样漂浮在空中。你可以拿起它们,观察它们,并决定如何处理。

有时,某个快照可能会包含一些不该存在的额外点——也许是你的手不小心挡住了,或者扫描仪看到了并不存在的反射。系统提供了一个虚拟的“裁剪平面”,它就像一张巨大的、隐形的玻璃板。你可以用虚拟双手抓取这张玻璃,并让它穿过点云。位于玻璃一侧的东西保留,另一侧的东西则会被切掉。这是一种非常简单、直观的清理数据的方法,无需理解复杂的数学知识。

清理完快照后,你可能想要合并它们。也许你拍了一张房间左侧的照片,又拍了一张右侧的照片。你可以选择这两团云,并告诉系统进行“合并”。计算机随后会提取两张照片中的所有点,将它们对齐,并创建一个更大的单一云团。论文指出,合并步骤是整个过程中最慢的部分,在他们使用的电脑上,合并三个快照大约需要 12 秒。但因为这是你主动进行的,而不是让计算机去猜测,所以你完全清楚自己得到了什么。

建造城堡:从点到墙壁

当你拥有了干净、合并后的点云,建造城堡的时间就到了。系统使用了一种被称为“截断符号距离函数”(TSDF)的数学技巧。想象一下,这些点是种在田野里的种子。TSDF 就像是在这些种子周围生长出的神奇迷雾。它知道种子位于表面,因此它会填充种子周围的空间,从而创造出一个光滑、连续的形状。

随后,系统使用一种经典的算法——“移动立方体”(Marching Cubes)在迷雾中穿行。它寻找迷雾中处于“内部”与“外部”之间恰好处于“一半”位置的隐形线条。它追踪这条线,并将其转化为三角形网格——这与制作视频游戏中的 3D 角色所使用的三角形类型相同。结果就是一个你刚刚扫描过的房间的坚实、光滑的 3D 模型。

最棒的部分是,你可以在头显内直接看到这个模型,它就漂浮在真实房间的精确位置。你可以绕着它走动,从不同角度观察,检查墙壁是否看起来正确。如果模型有洞或有奇怪的凸起,由于系统保留了每一步的完美记录,你完全知道是哪个快照导致了问题。

他们的发现及其意义

研究人员在连接到头显的标准游戏电脑上测试了他们的系统。他们发现,从拍摄快照到看到最终 3D 模型,整个过程仅需几秒钟。保存数据大约需要 3 秒,将合并后的点转化为光滑 3D 表面的过程总共也只需 3 秒。唯一的真正“瓶颈”是合并步骤,对于三个快照,合并大约需要 12 秒。

论文建议,这种方法是进行 3D 扫描的一种非常实用的方式。它证明了你不需要超级计算机,一台标准 PC 和一个消费级头显就足够了。然而,作者谨慎地表示,这是一项“可行性”研究。他们展示了这种方法是可行的,并且速度快到足以投入使用,但他们并没有精确测量其 3D 模型相对于专业激光扫描仪的完美程度。他们还注意到,如果头显的追踪出现轻微晃动(漂移),3D 模型可能无法完美对齐,这也是为什么让用户进行数据清理和合并如此重要的原因。

最后,MESH4ID 的核心在于将控制权交还给人类。它不再是信任一个黑盒算法来完成一切,而是创建了一个让你——用户——成为引导者的流程。你拍摄照片,你清理杂乱,你决定什么时候 3D 模型才算完成。它将复杂的 3D 重建科学变成了一种任何人只要戴上 VR 头显都能尝试的互动式体验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →