← 最新论文
🤖 AI

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

本文介绍了 MiniGPT-Reverse-Designing,这是一个经过微调的 MiniGPT-4 模型,它将视觉语言能力扩展到了复杂的任务中,即在给定源图像、编辑后的版本以及可选文本描述的情况下,预测图像编辑及其参数。

原作者: Vahid Azizi, Fatemeh Koochaki

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Vahid Azizi, Fatemeh Koochaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界中,计算机在两项独立的能力上已经变得非常出色:视觉和语言。一方面,视觉系统可以观察一张照片并以惊人的准确度描述正在发生的事情。另一方面,语言模型可以通过处理海量的文本来编写故事、回答问题并进行对话。最近,科学家们开始将这两种能力结合起来,创造出能够同时理解图像和句子的系统。这些被称为“视觉-语言模型”的混合工具已经可以执行诸如回答关于图片的提问或为场景编写说明文字等任务。然而,大多数此类系统被训练用于观察单张图像并对其进行描述,或者观察一张图片和一个问题并提供答案。它们尚未被训练去观察一对“前后对比”的图像,并弄清楚两者之间究竟发生了什么变化,尤其是当这种变化涉及亮度、对比度或色彩平衡等特定调整时。

这种理解上的差距正是 Vahid Azizi 和 Fatemeh Koochaki 研究人员开展的一项新研究的焦点。他们试图探索能否教会一个名为 MiniGPT-4 的强大开源视觉-语言模型执行一项被称为“逆向设计”的任务。想象一下,你有一张日落的照片,然后你有了同一张照片的第二个版本,其中天空变得更加橙红,水面变得更暗。人类编辑可能会知道为了实现那种效果移动了哪些滑块。研究人员想知道,计算机是否可以通过观察原始图像和编辑后的版本,或许配合一个模糊的提示,例如“让它更有戏剧性”,然后预测出用于创造该编辑效果的具体技术步骤和数值。这是一个复杂的挑战,因为计算机必须同时理解两张不同的图像以及它们之间的关系,这项任务超出了仅仅描述单张图片内容的范畴。

为了测试这一点,研究人员采用了已经过图像和文本理解训练的 MiniGPT-4 模型,并使用一个名为 I-MAD-Dense 的特定数据集对其进行了微调。该数据集包含约 22,000 个示例,每个示例都由一张源图像、该图像的编辑版本以及关于该编辑背后创意理念的高层级描述组成。至关重要的是,该数据集还包含了“地面真值”(ground truth),即用于创建新图像而应用于原始图像的精确操作列表及其数值。研究人员将这些技术性的操作列表转换成了句子,以便语言部分的模型能够读取。随后,他们将图像对以及可选的文本描述输入模型,并要求模型预测将第一张图像变为第二张图像的变化列表。

团队进行了多次实验,以观察模型学习这项技能的效果如何。在第一次尝试中,他们只是简单地对现有模型进行微调,而没有改变其结构。结果显示,模型可以学习这项任务,平均在 7-2% 的情况下成功预测了变化的类型。然而,研究人员注意到,模型有时会猜错变化的数量,或者将具体数值猜错。为了改进这一点,他们尝试在训练过程中添加了一个数学惩罚项,即每当模型预测的调整数值与正确数值偏差较大时,就会施加惩罚。这一小小的调整帮助模型获得了更准确的数值,降低了预测的平均误差。他们还测试了给模型一个特定的文本指令(例如“调整亮度”)是否会有所帮助。结果证实,拥有这种额外的文本上下文显著提高了模型寻找正确变化的能力,尤其是在指令清晰的情况下。

研究人员还探索了添加特殊的标记来分隔图像与文字,是否能帮助模型追踪不同的输入。他们尝试插入一个特定的标记(token)来标识一个图像在哪里结束以及下一个图像在哪里开始,但这实际上降低了模型的表现。这一发现表明,模型现有的处理图像和文本的方式已经足够,添加额外的、人工的标记反而使其产生了困惑,而非使其更清晰。另一个实验涉及尝试通过惩罚那些猜测过多或过少的行为,来教导模型更准确地预测变化的数量,但这种方法也未能提高结果,在某些情况下甚至使结果变差。

他们最成功的系统版本——即将微调后的模型与处理数值误差的特定方式相结合——表明,这些视觉-语言模型确实能够学习复杂的、多步骤的关系。该模型在获得编辑的文本描述时表现最佳,这突显了语言在引导视觉理解方面的重要性。虽然该系统尚未达到完美,且在处理某些复杂场景时仍有困难,但这项研究证明了现成的模型可以被扩展以处理像逆向工程图像编辑这样复杂的任务。研究人员总结道,尽管目前的结果令人鼓舞,但仍有提升空间,例如使用更高分辨率的图像以捕捉更精细的细节,或者在更精心策划的人类生成数据上进行训练。这项工作为未来的工具开启了一扇大门,这些工具可以帮助编辑理解自己的工作流程,或者允许计算机从图像创建的历史中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →