← 最新论文
💻 computer science

PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing

该论文介绍了 PhyEdit,这是一个通过利用显式 3D 几何模拟和 2D-3D 联合监督来增强图像编辑中真实世界物体操控能力的框架,并辅以全新的数据集(RealManip-40K)和基准测试(ManipEval),从而实现了比现有模型更优越的物理准确性和空间一致性。

原作者: Ruihang Xu, Dewei Zhou, Xiaolong Shen, Fan Ma, Yi Yang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruihang Xu, Dewei Zhou, Xiaolong Shen, Fan Ma, Yi Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款数字照片编辑器,就像那种你可以把猫从图片的左边拖到右边的工具。大多数这类工具的工作方式就像一张扁平的贴纸:它们只是在二维屏幕上滑动图像。但在现实世界中,世界并不是平坦的,而是有深度的。如果你在现实生活中把一个玩具车向你靠近,它不仅仅是横向滑动,它还会变大,细节变得清晰,并且可能会遮挡住后面的物体。这就是计算机科学中“3D操控”的难点所在。科学家们正试图教会计算机理解这种深度、透视和物理定律,以便当它们编辑照片时,物体表现得像真实存在的物体,而不是仅仅作为扁平的贴纸。这至关重要,因为如果我们希望计算机帮助机器人移动物体,或者构建模拟现实的“世界模型”,计算机就需要知道物体不能凭空穿过墙壁,也不能在没有理由的情况下改变大小。

于是,由浙江大学研究人员开发的名为 PhyEdit 的新工具应运而生,它试图解决这个“扁平贴纸”问题。可以将 PhyEdit 想象成一位数字雕塑家,他不仅是在画布上绘画,首先还在脑海中构建了一个场景的 3D 模型。当你要求 PhyEdit “把这根香蕉向左移动”时,它并不仅仅是滑动像素。相反,它使用一种特殊的“3D 基础模型”来推测香蕉的深度,将其从扁平的照片中“拎”到一个虚拟的 3D 空间中,移动到你想要的确切位置,然后将其重新投影回来。至关重要的是,它通过一个“联合监督”系统来检查自己的工作,这就像一位老师既批改最终的画作(2D 图像),又批改 3D 蓝图(深度图),以确保物体没有发生奇怪的缩小或拉伸。

研究人员发现,虽然现有的工具在尝试进行 3D 移动时经常会弄乱物体的尺寸或位置,但 PhyEdit 在保持物理准确性方面表现得好得多。为了证明这一点,他们不仅仅是靠猜测;他们构建了一个庞大的新数据集,名为 RealManip-40K,其中包含 40,000 对展示物体在 3D 空间中移动的真实照片,并附带了完整的深度测量数据。他们还创建了一个名为 ManipEval 的测试,用于评估不同 AI 模型处理这些移动的效果。当运行测试时,PhayEdit 击败了许多其他方法,包括一些需要付费使用的非常强大的商业模型。例如,在一个衡量物体新位置与目标位置接近程度的特定测试中,PhyEdit 得分为 65.33(分值为 0 到 100),而排名第二的商业模型 Nano Banana Pro 得分为 59.97。在 3D 形状准确度(倒角距离/Chamfer distance)方面,PhyEdit 实现了 18.93 的得分,显著低于商业模型的 25.33(数值越低代表表现越好)。

论文指出,这种方法之所以奏效,是因为它结合了一个“即插即用”的 3D 指导功能,以及一种同时观察 2D 图像和 3D 深度的训练方法。然而,作者也谨慎地指出,这目前还不是一根完美的魔杖。如果它构建的 3D 地图出错了(比如深度传感器被反光物体干扰),或者请求过于极端(比如将物体移动到离摄像机太近以至于会消失在镜头后),该系统仍然会遇到困难。他们还发现,虽然 PhyEdit 在移动物体方面表现出色,但除非你给出非常具体的指令,否则它在改变物体的颜色或纹理方面并不一定更有优势。最终,论文表明,通过将图像编辑建立在真实的物理学和 3D 几何学基础上,我们正朝着创造能够真正理解并操控世界的 AI 迈出重要的一步,而不仅仅是让它在扁平的屏幕上重新排列像素。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →