ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline
ReVision 是一个无需训练的后验安全性框架,它利用视觉-语言模型辅助的空间门控机制,在不损害背景完整性且无需重新训练底层生成器的情况下,精确地识别并编辑生成图像中不可接受的概念。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你只需在电脑上输入一句话,砰!——一张全新的、超写实的图片就出现了。这就是“生成式人工智能”(Generative AI)的魔力,这项技术正以前所未有的速度爆发式增长,让任何人都能凭空创造艺术、照片和场景。但是,就像一个强大的新工具既可以用来盖房子也可以用来制造武器一样,这些图像生成器也有其阴暗面。有时,人们试图通过巧妙的手段诱导它们生成危险、非法或纯粹不当的内容,比如暴力、裸露,或是未经许可使用真实名人的图像。
为了阻止这种情况,公司通常会尝试在 AI 中构建“护栏”(guardrails)。它们可能会在图片生成前拦截不当词汇,或者教 AI 忘记某些概念。但这些方法都有缺陷。心怀叵测的人经常能通过巧妙的文字游戏绕过护栏,而且修复 AI 的“大脑”往往会导致生成的图片质量变差,或者需要耗时且昂贵的重新训练。因此,科学家们提出了一个重大问题:是否有一种方法可以在一张坏图被制作出来之后进行修复,且不破坏图像的其他部分?这就像拥有一种神奇的橡皮擦,可以移除照片中特定的不想要物体,却不会弄脏背景中美丽的落日。
于是,ReVision 应运而生,这是由研究员 Gurjot Singh 及其团队提出的一种新技术。可以将 ReVision 理解为一个超级智能的后期编辑软件,它充当了 AI 生成图像的“安全网”。ReVision 并不试图在源头上阻止 AI 犯错,而是等待图片完成后,观察它,并精准地移除那些“不可接受”的部分,同时保持其他部分完好无损。
研究人员发现,之前的“安全编辑器”通常存在一个笨拙的问题:它们就像一把过大的画笔。如果你试图涂掉人群中的一个坏人,画笔可能会误伤站在他旁边的无辜路人,从而毁掉整个场景。这是因为计算机无法准确判断到底应该修复哪一个物体。
ReVision 通过一个聪明的两步走策略解决了这个问题。首先,它使用了一个“视觉-语言模型”(一种能同时理解图像和文字的 AI 类型)来扮演侦探的角色。这个侦探会观察图像并说:“啊哈!我在这里看到了一位名人,在那儿看到了一件武器。”至关重要的一点是,它不仅仅是猜测;它会在不当物体周围画出一个精确的、隐形的方框,就像保安指着麻烦制造者一样明确。
其次,ReVision 使用了一种“空间门控”(spatial gating)机制。想象一下,编辑过程就像是一股试图冲走错误概念的水流。如果没有这个门控,水可能会溢出并淹没整个房间。但 ReVision 在侦探画出的隐形方框周围筑起了一道坝。现在,“水”(即编辑魔法)只能在那个方框内流动。它会将错误的属性替换为安全的属性——比如将裸体人物变成穿着衣服的人,或者将知名演员变成一个陌生人——而完全不会触及旁边的人。
该团队在包含复杂场景(如多人或多物体场景)的大规模 8ed 图像集上进行了测试。结果令人印象深刻。当他们尝试移除“裸露”内容时,ReVision 成功消除了所有检测到的裸露现象(从 70.51 次检测降至 0),而旧的方法往往会留下痕迹,或者误改了附近无辜者的衣服。在处理多个概念的测试中,ReVision 将背景中的“噪声”或不必要的改变从 0.166 降低到了 0.058,这在保持图像自然度方面取得了巨大进步。
或许最具有说服力的测试是人类研究。当人们观察原始的不安全图像时,能识别出不当内容的概率为 96%。而在 ReVision 完成工作后,人类识别出这些不可接受内容的能力仅为 10%。更棒的是,图像中“安全”部分的细节并未受到误改。
研究人员强调,这种方法是“无需训练”(training-free)的,这意味着它不需要重新学习如何绘画,也不需要原始 AI 公司更改其代码。它作为一个通用的插件,可以被任何人接入,以确保其 AI 图像的安全。虽然这项研究表明这是一个重大的进步,但作者也指出,他们的测试图像是专门为实验创建的,未来的工作仍需验证其在各种现实世界场景中的表现。但就目前而言,ReVision 提供了一种精准且极具前景的方法,让 AI 艺术的魔力不至于演变成一场噩梦,确保我们在剔除坏的部分时,不会意外抹去好的部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。