CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels
该论文介绍了 CapFrame,这是一个旨在解决 3D 高斯泼溅(3D Gaussian Splatting)场景中文本指令视角定位(Text-Instructed Viewpoint Grounding, TIVG)任务的新型框架,它通过检索-翻译-精炼(Retrieve-Translate-Refine)流水线将文本指令转换为几何伪标签,从而自动优化用于实现理想帧构图的 6 自由度(6-DoF)相机位姿。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正站在一个被完美地在计算机中重建的房间里,它不是一张平面照片,而是一个你可以走进去的三维空间。近年来,科学家们开发出了构建这些数字房间的方法,使其真实到看起来像照片一样,并且可以从任何角度即时查看。这项被称为“3D 高斯泼溅”(3D Gaussian Splating)的技术,为极其逼真的虚拟现实体验开启了大门。然而,一个显著的障碍仍然存在:虽然这个房间确实存在,但要找到一个完美的地点来拍摄特定场景的照片,仍然是一个手动且繁琐的过程。如果用户想要一个画面右侧坐着一只泰迪熊、面向左侧一只绵羊,且相机略微倾斜的视角,他们目前必须通过不断猜测和尝试,来回移动虚拟相机,直到构图感觉满意为止。现有的工具可以找到物体,但它们难以理解如何将这些物体在单张快照中进行艺术化排列的意图。
为了解决这个问题,一个研究小组推出了一种名为 CapFrame 的新方法,它允许计算机自动找到与书面描述相匹配的确切相机位置。该系统不仅仅是定位一个物体,它还能理解关于布局、朝向和相机角度的复杂指令。研究人员在 3 种不同的现实场景(从室内房间到室外景观)中测试了这种方法,使用了 135 条具体的文本指令。他们发现,与以往经常无法准确捕捉主体位置或相机倾斜度的技术相比,他们的方法能够一致地产生与书面描述高度吻合的视角。通过将人类语言转化为几何规则,CapFrame 弥合了简单句子与精确、逼真的图像之间的鸿沟。
这项创新的核心在于计算机如何解读语言。传统方法可能会寻找“泰迪熊”然后就停止了,但 CapFrame 会将像“一只大棕色泰迪熊坐在右侧,面向左侧的一只白色毛绒绵羊”这样的句子分解为一系列具体的问题。它会自问:熊可见吗?它在右边吗?它的朝向正确吗?为了回答这些问题,该系统使用了一种经过训练、能够理解图像和文本的强大人工智能。这种人工智能充当了一个评判者,扫描 3D 场景中数以千计的现有视角,以寻找最接近描述的视角。它不仅仅是挑选第一个匹配项;它还会根据满足指令各项内容的程度对它们进行排名,从而确保下一步的起点已经非常理想。
一旦系统找到了一个有潜力的初始视角,它就会将指令中模糊的词汇转化为具体的几何目标。它会在脑海中绘制出一张地图,确定熊应该在画面的什么位置,以及相机应该如何倾斜。例如,如果指令说相机应逆时针倾斜 20 度,系统会将此转换为相机旋转的一个特定数值目标。它还会定义一个目标区域供泰迪熊占据,以确保它位于画面的右侧。这些目标就像一个指南,在计算机开始移动相机之前,就告诉了计算机最终的图像应该是什么样子。
最后一步是数学发挥魔力的地方,尽管用户无需理解其中的方程。系统会获取相机位置并开始进行微调,测试数百万次细微的调整,以观察哪个方向能让图像看起来更符合描述。它通过计算当前图像与之前设定的目标目标之间的差异来进行操作。如果熊离左边太远,系统就会将相机向右移动。如果相机倾斜的角度不对,它就会修正角度。这个过程是持续且自动进行的,不断优化视角,直到图像完美契合文本指令。研究人员发现,这个精细化步骤至关重要;仅仅从数据库中挑选一个视角是不够的,基于书面规则对位置进行微调才能产生一种具有意图感且精准的结果。
在实验中,研究人员将他们的新方法与依赖于简单猜测或基本搜索模式的旧技术进行了对比。结果显而易见:旧方法经常会将主体放置在错误的位置,或者无法捕捉到正确的角度。例如,当要求展示一份带有三明治作为主菜后方的餐食特写时,旧系统可能会显示食物,但会错过特定的排列方式。然而,CapFrame 却能成功地按照描述布置场景。团队还邀请了人类志愿者来评判结果,参与者压倒性地更喜欢 CapFrame 生成的图像,认为它们感觉更自然,且与指令的契合度更高。
这项工作证明了计算机现在不仅能理解场景中有什么,还能理解人类摄影师会如何选择构图。通过将理解复杂描述的能力与实时调整 3D 相机的能力相结合,CapFrame 使得仅凭文字即可探索虚拟环境成为可能。它将体验从手动搜索转变为直观的对话——用户只需提出要求,即可获得一张构图完美的图像。虽然该系统仍然依赖于初始 3D 场景的质量和文本的清晰度,但它代表了在使数字世界更易于导航以及对人类意图更具响应性方面迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。