PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media
本文介绍了 PROVE 框架,该框架包含感知对齐的 RC-S 和 RC-T 指标以及 PROVE-Bench 数据集,旨在通过提供更符合人类判断的视觉媒体中物体移除连贯性评估,以解决现有评估方法的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名受雇从合影中移除抢镜者的照片编辑师。你干得很漂亮:那个人消失了,背景看起来也很自然。但你怎么知道你的修图是否真的好呢?
这正是论文PROVE所解决的问题。作者们认为,我们目前用来评估这些修图效果的工具,就像用尺子去测量汤的味道——它们关注错了对象。
以下是他们解决方案的通俗类比解析。
1. 问题所在:“复制粘贴”与“模糊”陷阱
论文指出,现有的评估工具(指标)犯了两个主要错误:
- “复制粘贴”陷阱(全参考指标): 想象一位老师通过逐字对比范文来批改学生的作文。如果学生完美地复制了范文,即使文章枯燥无味,也能得 A。
- 在图像编辑中,旧工具奖励那些仅仅从原图中“复制粘贴”背景,而不是真正“擦除”物体并生成新的、逼真的背景的模式。它们偏爱安全、枯燥的答案,而非富有创意且逼真的答案。
- “模糊即干净”陷阱(无参考指标): 想象一位评委认为模糊的照片比清晰的照片更好,因为模糊掩盖了错误。
- 目前的工具往往给模糊的结果打高分,因为模糊让事物看起来“平滑”且均匀。它们未能注意到图像实际上质量低下,或者物体移除造成了奇怪的伪影。
视频问题: 在编辑视频时,现有工具会审视整个屏幕。如果背景稳定,但物体被移除的区域剧烈闪烁,工具仍可能给出高分,因为视频的其他部分没问题。这就像老师批改一篇 10 页的论文,却只读了第一页而忽略了其余部分。
2. 解决方案:“聚光灯”方法(RC 指标)
作者们提出了一种名为**RC(移除一致性)**的新评估方法。他们不是审视整张图片或与完美的参考图进行比较,而是使用“滑动聚光灯”放大到物体被移除的具体区域。
他们拥有两个主要工具:
- RC-S(空间一致性): 把它想象成一位纹理侦探。它放大物体留下的空洞,问道:“这里的新背景看起来像周围的‘街区’吗?”
- 它使用滑动窗口(像放大镜一样)检查纹理、光照和图案是否与编辑区域周围相匹配。如果新背景看起来纹理不同或过于模糊,分数就会下降。
- RC-T(时间一致性): 这是视频稳定性检查员。它观察连续两帧中同一位置的情况。
- 它问道:“随着视频播放,这个位置是否跳动或闪烁?”如果移除区域的背景在帧与帧之间抖动或发生奇怪的变化,即使视频其余部分很平滑,该指标也能捕捉到这一点。
秘密武器: 他们使用了一个特殊的“大脑”(称为 DINOv2 的特征提取器),它对微小细节和频率变化非常敏感,就像人眼对细微的视觉故障很敏感一样。
3. 新游乐场:PROVE-Bench
为了证明他们新的评估系统有效,他们建立了一个名为PROVE-Bench的新测试平台。他们意识到,旧的测试集要么:
- 太假: 计算机生成的视频,看起来不像现实生活。
- 太难评估: 真实视频,但我们不知道“完美”的背景应该是什么样子。
他们的新基准包含两部分:
- PROVE-M(受控实验室): 他们拍摄了真实场景,移除了一个物体,然后再次拍摄没有该物体的场景。这为他们提供了完美的“真实值”进行对比,但他们添加了模拟的相机抖动,使其感觉像真实的 handheld 视频。
- PROVE-H(压力测试): 包含 100 个困难的真实世界视频(人群、快速运动、反光),在这些视频中他们没有完美的参考图。这测试了模型能否应对混乱。
4. 结果
当他们用新的“聚光灯”评估系统与旧工具进行对比测试时:
- 旧工具经常给模糊的、复制粘贴的结果打高分,或者忽略了视频中的闪烁。
- PROVE(RC-S 和 RC-T) 与实际人类认为好看的内容更加一致。如果人类说“那看起来很假”,新指标也会同意。如果人类说“那看起来很棒”,新指标也会同意。
总结
论文认为,要评估物体移除效果,我们需要停止审视整张图片或与完美参考图进行比较。相反,我们需要放大到编辑区域,检查它是否与邻居融合(空间),并随时间保持稳定(时间)。他们构建了一套新工具和一个新测试平台,以证明这种“放大”方法是获得与人类感知相符的评分的唯一途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。