MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations
本文介绍了用于评估纹理叠加退化下图像修复效果的 MDTD-Art 数据集与基准测试,并揭示了通过结构化提示工程增强的图像编辑模型在保留语义和结构细节方面优于专门的修复架构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名艺术品修复师,但你手里拿的不是尘土飞扬的画笔和调色板,而是一个超级聪明的计算机程序。你的工作是修复陈旧、受损的画作——也许是一幅像干涸河床一样布满裂纹的画,又或者是另一幅被神秘黄斑弄脏的画,或者第三幅则是画布的一部分直接消失了。这就是AI驱动的艺术修复领域,在这个领域中,计算机试图去猜想在一场时间与意外破坏了杰作之前,它原本是什么样子的。但这里有一个棘手之处:计算机不仅需要填补空白处,它还需要在不凭空捏造从未存在过的荒诞细节的情况下完成任务。这就像是在尝试接续一个朋友没说完的故事——当他们在故事中途停下来时,你想要猜出一个符合他们风格的结局,而不是在写悬疑小说时突然编出一个巨龙。
为了测试这些计算机程序是否真的出色,科学家们通常会给它们出一些练习题。但大多数练习题要么太简单,要么太假。它们可能会要求计算机修复一张模糊的照片或去除一些雨滴,这就像是在尝试修复一扇破碎的彩色玻璃窗之前,先练习擦拭一扇略微模糊的窗户。核心问题在于,研究人员正在追问:我们最优秀的AI工具真的能在处理这种混乱、真实的现实世界损伤时,又不丢失艺术品的灵魂吗?
伟大的艺术劫案:当AI试图修复一幅画作
见见 MDTD-Art 团队,这是一群来自杜伦大学的研究人员,他们决定为AI艺术修复师建立一个全新的、极具挑战性的训练场。他们意识到,旧的测试方法就像是在对着一张坏掉的唱片玩“老师说”游戏——指令太简单,且损伤太容易预测。因此,他们发明了一个新游戏,叫做 MDTD-ArtIR。
把他们的这个新数据集想象成一个“损伤模拟器”。他们不仅仅是让图片变模糊,而是选取了精美、洁净的画作,并在其上叠加了47种不同类型的奇特纹理——比如干裂的泥土、溅落的油漆或多孔的海绵。但他们并不只是把这些纹理贴上去,他们还玩转了一个“透明度旋钮”。他们可以让损伤变得很轻微(低不透明度),就像撒了一层薄薄的粉末;也可以让它变得厚重且浓稠(高不透明度),就像往画作上泼了一桶泥浆。这创造了一个从“易如反掌”到“祝你好运,你需要一个奇迹”的难度光谱。
竞赛:专业机械师 vs. 创意讲述者
研究人员组织了一场两类AI模型的对决:
- 专业机械师(通用图像修复模型): 这些是“修理型”机器人。它们经过专门训练,用于去除划痕、噪点或模糊。它们就像一位精通如何修理损坏齿轮的钟表匠。
- 创意讲述者(图像编辑模型): 这些是“脑补型”机器人。它们通常用于改变照片(比如把狗变成猫,或者戴上一顶帽子)。它们就像一位根据少量线索进行即兴创作的创意作家。
团队想要看看,当损伤严重且线索稀缺时,谁能更好地修复画作。他们使用两种不同的“说明书”(提示词)来测试这些模型:
- 简单提示词: 只说,“修复这个。”
- 专家提示词: 说,“你是一位专业的修复师。掩码部分是损伤而非艺术。请移除它并重建原始场景。”
大惊喜:讲述者赢了(大部分时候)
这里是论文发现的转折点:创意讲述者(图像编辑模型)通常表现得比专业机械师更好。
当损伤较轻(低不透明度)时,大家都表现尚可。但随着“泥浆”变得越来越厚(高不透明度),专业机械师开始显得力不从心。它们往往会留下损伤,或者以一种僵硬、不自然的方式进行修复。它们太专注于“修复规则”,而缺乏想象力去猜测遮盖物之下是什么。
然而,创意讲述者在猜测缺失部分方面表现得好得多。当研究人员给出专家提示词(即那个清晰解释了任务的提示词)时,这些模型的表现甚至更上一层楼。例如,Nano Banana (NB) Pro 模型在处理高不透明度图像时,其图像质量得分从 9.63 dB 跳升到了 11.87 dB。Flux 2 模型也出现了类似的飞跃,从 8.57 dB 提升到了 11.01 dB。这就像讲述者突然理解了任务要求:“噢,我不应该只是在泥巴上涂抹;我应该想象它原本的样子!”
陷阱:当想象力过度时
但这里有一个陷阱。因为这些“讲述者”模型太擅长编故事了,它们有时会变得“过于有创意”。在最糟糕的情况下,它们不仅修复了画作,甚至改变了整个故事。
论文展示了一些有趣(但也令人难过)的例子,AI看着一张带有裂纹的面部,却决定:“我觉得这个人应该有一个不同的鼻子”;或者看着一幅风景画,决定添加一座原本不存在的山。这被称为“幻觉”。FireRed 模型主要针对面部进行训练,它被形似脸部的裂纹搞糊涂了,竟然“劫持”了图像,把整幅画变成了一个奇怪、模糊的脸。GPT Image 1.5 和 NB Pro 是保持原始特征最好的模型,但即使是它们,有时也会稍微改变颜色或图片的形状。
结论:清晰度是关键
这篇论文的主要启示是,对于修复真正受损的艺术品而言,你如何提问比你使用什么工具更重要。
- 专业工具(如 AutoDIR)在保护原始图像方面表现出色,但往往无法移除沉重、奇特的纹理。
- 创意工具(如 NB Pro 和 Flux)在猜测缺失部分方面非常惊人,但它们需要清晰的指令来防止它们捏造虚假细节。
- “专家提示词” 是秘密武器。当AI被明确告知“这是损伤,不是艺术”时,它的表现会好得多,尤其是在损伤严重的情况下。
作者们指出,虽然这些创意模型功能强大,但它们还不完美。它们仍然会被误导并改变艺术品的身份。但通过使用正确的指令,并理解这些模型更擅长“猜故事”而非“修齿轮”,我们可以更接近于在不丢失灵魂的前提下修复珍贵的艺术品。这提醒了我们,在AI的世界里,有时修复一张破碎图片的最好方式,是要求计算机去想象它“应该”是什么样子,而不是仅仅告诉它如何缝补漏洞。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。