← 最新论文
💻 computer science

Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal

本文提出了 JFSnet,这是一个基于物理规律的视频眼镜去除框架,该框架通过合成数据增强和光学模拟,从商业生成模型中迁移多视图知识,以实现高保真、时序一致的修复,同时防止身份漂移。

原作者: Radim Spetlik, David Futschik, Radek Danecek, Feitong Tan, Ziqian Bai, Rohit Pandey, Yinda Zhang

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Radim Spetlik, David Futschik, Radek Danecek, Feitong Tan, Ziqian Bai, Rohit Pandey, Yinda Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字图像的世界里,面部是我们所知的最容易辨认的地标。我们能瞬间通过眼睛、鼻子和嘴巴的独特排列,识别出朋友、名人或陌生人。然而,当一个人佩戴眼镜时,一层复杂的光学屏障便横亘在观察者与真实的脸庞之间。镜片不仅仅是扁平的塑料片;它们是弯曲的表面,会弯曲光线,使其背后的特征放大或缩小,同时镜框也会投下阴影并产生锐利的反射。几十年来,计算机科学家一直试图教会机器从照片和视频中移除这些眼镜,希望能揭示眼镜下的真实面容。早期的尝试通常依赖于猜测隐藏的面部可能是什么样子,利用庞大的人脸库来填补空白。虽然这些方法有时能生成看起来合理的眼睛,但它们经常无法保留一个人的真实身份,会在无意中改变他们的表情、偏移他们的视线,或模糊掉那些让面部变得独特的精细细节。挑战在于,如何在去除眼镜的同时不丢失那个人。

一组研究人员现在开发了一种新方法,将眼镜的移除视为一个物理问题,而非一场猜谜游戏。他们不再要求人工智能去想象透镜之下隐藏着什么,而是构建了一个理解光线穿过玻璃时实际行为的系统。研究人员创建了一个流程,首先生成数千对合成的面部图像:一组显示不戴眼镜的人,另一组显示同一人戴着眼镜。为了确保这些配对完美对齐,他们使用了一种复杂的过滤过程,剔除了任何人物姿态或表情发生轻微漂移的图像。随后,他们并非仅仅依赖这些生成的图像,而是模拟了光的实际物理折射过程。他们计算了特定镜片如何弯曲来自人眼的 light(光线),从而创造出一种真实的畸变,让计算机可以学习如何将其逆转。这一过程使他们能够训练一个专门的网络,他们称之为“联合特征-空间网络”(joint feature-spatial network),使其充当眼镜的数字“撤销”按钮。

该方法的结果标志着机器理解和编辑视频方面迈出了重要一步。在对数千张高分辨率肖像进行测试时,该系统成功地移除了眼镜,同时保持了人物身份的完整,达到了以往方法无法比拟的细节水平。在人物移动且光线变化的视频序列中,该系统保持了稳定、无闪烁的结果,保留了视线的精确方向以及面部肌肉的细微运动。在与包括商业视频编辑器和基于图像的生成器在内的其他先进工具进行直接对比时,由于该方法能够让脸部看起来与原主一致,人类观察者一致更倾向于这种新方法。该系统运行速度极快,处理视频的速度接近每秒二十八帧,足以满足实时应用的需求。

研究人员还证明了他们的方法避免了早期技术的常见陷阱。许多先前的系统会“幻觉”出新的特征,例如改变一个人的瞳色或改变其微笑的形状,因为它们试图从头开始生成一张新脸。通过将训练建立在光学物理定律的基础上,新系统学会了仅仅逆转由镜片引起的畸变,从而揭示出原本就在那里的脸。这种区别至关重要:系统并非在发明一个新人,而是在揭开那个被遮挡的人。这项研究证实,通过将大规模图像生成器的创造力与物理学的严谨规则相结合,可以实现以前无法企及的保真度。这项工作表明,数字编辑的未来不仅在于生成新内容,更在于理解创造这些内容的物理现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →