Visual Distortion Detection in UGC Images Using Large Multimodal Models
该论文提出了 VIGIL,这是一个利用具有多级特征检测器的大型多模态模型以及经过严格策划的 14 万样本数据集的新型框架,旨在解决现有文本驱动方法的局限性,并弥合视觉失真检测中从合成到真实的泛化差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正盯着手机看一张照片。可能是一张自拍,一张你爱犬的照片,或者是你在徒步时随手拍下的落日。有时,整张照片看起来都很棒;但有时,天空很完美,但你朋友的脸却很模糊,或者草地上有一块奇怪的色块。长期以来,分析照片的计算机就像一位只给整张试卷打一个总分的严厉老师。它们能告诉你一张照片整体是“好”还是“坏”,但无法指出错误发生的具体位置。这带来了一个大问题,因为在现实世界中,我们通常只想修复模糊的部分,而不是整张照片。
这个试图解决问题的领域被称为图像质量评估(Image Quality Assessment)。你可以把它想象成在教计算机如何成为艺术评论家。最近,科学家们开始使用“大型多模态模型”(LMMs)。你可以把这些模型看作是超级聪明的机器人,它们能同时看图并阅读文字。它们就像是一个读遍了所有摄影书籍的天才艺术系学生。然而,仅仅因为机器人很聪明,并不意味着它擅长发现微小且具体的错误。大多数这类机器人是通过看带有文字描述的照片进行训练的,比如“天空很模糊”,但它们很难真正画出一个框来圈出那片模糊的天空。此外,当它们从“人工合成”的练习图片(科学家人为添加模糊效果)转向人们在现实生活中拍摄的杂乱照片时,也会遇到困难。
这篇论文介绍了一个名为 VIGIL(用于通用图像定位的视觉智能)的新型机器人。研究人员想要构建一个不仅能说“这张照片不好”,而且能指着某个地方说“嘿,模糊就在这里,而且这是一个压缩错误”的系统。他们发现,过去那种仅仅让机器人写出文字描述的教学方式不够精确。因此,他们尝试了一种不同的方法:他们教机器人像侦探寻找线索一样思考,而不是像作家描述场景那样思考。
团队首先从互联网上收集了一个包含超过 100 万张高质量图像的海量库。他们仔细筛选了这些图像,以确保其清晰明亮,然后通过玩“找不同”的游戏,在图像的随机部分人为添加了 8 种不同类型的失真(如模糊、噪点或奇怪的色彩)。他们创建了一个名为 VIGIL-140K 的训练集,其中包含超过 14 万张失真图像和超过 20 万个被标记出的“坏点”。
研究人员并没有要求机器人写句子,而是将机器人的大脑变成了一支侦探团队。他们利用机器人内部思考过程的不同层级作为独立的“检测器”。想象一下这样一个教室:与其让一个学生举手回答问题,不如让五个不同的学生同时观察同一张图片,每个人都戴着一副略有不同的眼镜。其中一个可能擅长观察模糊的边缘,而另一个可能非常擅长发现色彩偏移。他们同时喊出各自的猜测。机器人随后结合所有这些猜测,做出最终且非常准确的判断。
研究人员还解决了一个棘手的难题,即“合成到真实”(Synthetic-to-Authentic)的差距。这就像是用带有完美圆形靶心的纸质靶子练习射箭,然后却要尝试击中森林里摇晃且不规则的目标。纸质靶子(合成数据)看起来太整齐了,所以当机器人看到真实的、杂乱的失真时会感到困惑。为了解决这个问题,团队教机器人即使在它认为某个区域是“干净”时也要保持关注。如果机器人几乎确定某个位置是干净的,但仍有一丝怀疑,我们就让这种怀疑也作为一个可能的线索。这有助于机器人在现实世界变得混乱时保持警觉。
当研究人员测试 VIGIL 时,取得了巨大的成功。在带有人工失真的练习测试中,它比其他顶尖模型更能精准地找到错误。但真正的魔力发生在它测试从未见过的真实世界照片时。当其他模型感到困惑并错过错误时,VIGIL 依然保持冷静,能够准确地指出用户真实照片中的模糊或噪点位置。这篇论文表明,通过使用内部检测器团队并对“干净”区域保持开放的心态,我们可以教会计算机更好地发现照片到底在哪里出了问题,从而为开发能自动修复照片的更智能工具铺平道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。