← 最新论文
💻 computer science

AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments

本文提出了 AdaSFormer,一种专为室内单目语义场景补全设计的自适应序列化 Transformer 框架,通过引入可学习偏移、中心相对位置编码及卷积调制层归一化等创新机制,有效克服了传统 Transformer 在内存消耗和细节重建上的局限,并在 NYUv2 和 Occ-ScanNet 数据集上实现了最先进的性能。

原作者: Xuzhi Wang, Xinran Wu, Song Wang, Lingdong Kong, Ziping Zhao

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuzhi Wang, Xinran Wu, Song Wang, Lingdong Kong, Ziping Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 AdaSFormer 的新 AI 模型,它的任务是:只给你看一张普通的室内照片(比如手机拍的一张客厅照片),AI 就能在脑海里“脑补”出整个房间的完整 3D 结构,包括那些被家具挡住、看不见的角落,并给每个物体贴上标签(比如这是沙发、那是桌子)。

这项技术叫“单目语义场景补全”。听起来很酷,但在室内做这件事特别难,因为房间里有墙壁、天花板、各种家具,东西堆得密密麻麻,遮挡非常严重。

为了让你更容易理解,我们可以把这项技术比作**“一位拥有超能力的室内装修侦探”**。

1. 以前的侦探遇到了什么麻烦?

在 AdaSFormer 出现之前,AI 侦探主要靠两种方法:

  • 方法一:拿着放大镜看局部(卷积神经网络 CNN)

    • 比喻:以前的侦探手里拿着一个很小的放大镜,只能看清眼前的几块砖。他必须一块一块地拼凑,才能知道整个房间长什么样。
    • 缺点:如果房间很大,或者沙发挡住了电视,侦探就看不到了。他很难理解“沙发后面可能还有一面墙”这种全局关系。而且,如果房间特别大,拿着放大镜看遍每一个角落,侦探会累死(计算量太大)。
  • 方法二:试图一眼看穿整个宇宙(Transformer)

    • 比喻:后来的侦探想:“我干脆把整个房间的所有细节都同时看一遍!”于是他们试图用一种“上帝视角”来同时处理所有信息。
    • 缺点:这太费脑子了!对于室内这种复杂的空间,如果要把所有像素点都同时分析,侦探的大脑(显存)会直接爆炸(内存溢出,OOM),根本跑不起来。

2. AdaSFormer 是怎么做的?(三大绝招)

AdaSFormer 就像是一位**“聪明的装修侦探”**,它结合了上述两种方法的优点,并发明了三个独门绝技:

绝招一:自适应“串糖葫芦”法 (Adaptive Serialized Attention)

  • 传统做法:以前的方法像把房间切成固定的小方块(比如每块 4x4 米),不管里面有没有东西,都硬切。如果切到了空的地方,就是浪费;如果切到了大沙发,可能把沙发切碎了,看不清整体。
  • AdaSFormer 的做法
    • 比喻:想象你要把房间里的物体串成一串“糖葫芦”。以前的方法是固定每隔几厘米串一个,不管那是空气还是家具。
    • 创新:AdaSFormer 的“串法”是活的!它有一个**“可学习的偏移量”**。就像侦探手里有一根可以随意伸缩、滑动的签子。
    • 效果:当它发现前面是一堆空空气时,它会自动把签子往后滑,跳过空地;当它发现前面是个大沙发时,它会调整位置,把整个沙发完整地串起来。这样,它既能看清局部细节,又能一眼看穿整个物体的结构,而且不用处理那些没用的空气,省脑子又省内存

绝招二:以“房间中心”为坐标的指南针 (Center-Relative Positional Encoding)

  • 问题:AI 有时候会迷路,不知道这个物体是在房间的左边还是右边,离天花板有多远。
  • AdaSFormer 的做法
    • 比喻:普通的地图只告诉你“你在哪”,但 AdaSFormer 给了侦探一个**“以房间中心为圆心的指南针”**。
    • 创新:它不只看物体本身的坐标,而是计算物体相对于**“房间中心点”**的角度(比如:这个椅子在中心的“左前方 30 度,仰角 10 度”)。
    • 效果:这让 AI 对空间布局有了极强的感知力。它知道“沙发通常离地很近,而吊灯通常离天花板很近”,从而更准确地推断出被遮挡物体的位置。

绝招三:给大脑和双手“打补丁” (Convolution-Modulated Layer Normalization)

  • 问题:这个模型很聪明,它既有“全局视野”(Transformer 模块),又有“局部细节”(卷积模块)。但是,这两者说话的方式不一样,就像一个人左手写字、右手画画,如果不协调,大脑会打架,学得很慢。
  • AdaSFormer 的做法
    • 比喻:它在“全局视野”和“局部细节”之间加了一个**“翻译官”**(CMLN 模块)。
    • 创新:这个翻译官会根据当前的情况,自动调整“全局视野”输出的数据格式,让它能完美地融合进“局部细节”的处理流程中。
    • 效果:让 AI 的“大脑”(Transformer)和“双手”(卷积)配合得天衣无缝,既保留了全局推理能力,又没丢掉精细的几何细节。

3. 结果怎么样?

  • 更准:在著名的室内数据集(NYUv2 和 Occ-ScanNet)上,AdaSFormer 的表现是目前最强的(State-of-the-art)。它能更准确地还原被挡住的墙壁、地板和家具。
  • 更快更省:虽然它看起来很聪明,但它比那些试图“一眼看穿宇宙”的笨重模型要快得多,也省内存得多。就像它用“串糖葫芦”的方式,只串有用的东西,不串空气,所以跑起来飞快。

总结

简单来说,AdaSFormer 就是一个懂得“灵活变通”的 3D 空间重建专家
它不再死板地切分房间,而是像穿针引线一样,根据物体的形状动态调整观察视角;它利用房间中心作为参照物来定位;它还让不同的 AI 模块和谐共处

这项技术未来可以用在机器人导航(让机器人看懂复杂的室内环境)、VR/AR 装修(手机扫一下就能看全屋 3D 效果)以及自动驾驶(虽然这篇主要讲室内,但原理通用)等领域。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →