ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline
ReVision is een training-vrij, post-hoc veiligheidskader dat een door een vision-language model ondersteund ruimtelijk gating-mechanisme benut om onacceptabele concepten in gegenereerde afbeeldingen nauwkeurig te identificeren en te bewerken zonder de integriteit van de achtergrond in gevaar te brengen of het her trainen van de onderliggende generator te vereisen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je een zin in een computer kunt typen en, poef!—er verschijnt een gloednieuwe, hyperrealistische afbeelding. Dit is de magie van "generatieve AI", een technologie die een enorme populariteit heeft gekregen en iedereen in staat stelt om kunst, foto's en scènes uit het niets te creëren. Maar, net zoals een krachtig nieuw hulpmiddel gebruikt kan worden om een huis te bouwen of een wapen, hebben deze beeldmakers ook een duistere kant. Soms proberen mensen de AI te misleiken om dingen te maken die gevaarlijk, illegaal of gewoon ongepast zijn, zoals geweld, naaktheid of afbeeldingen van echte beroemdheden zonder hun toestemming.
Om dit te stoppen, proberen bedrijven meestal "vangrails" in de AI in te bouwen. Ze kunnen slechte woorden blokkeren voordat de afbeelding wordt gemaakt of de AI leren om bepaalde ideeën te vergeten. Maar deze methoden hebben gebreken. Slechtwillende actoren kunnen de vangrails vaak misleiden met slimme woordspelingen, en het repareren van het "brein" van de AI maakt de afbeeldingen vaak slechter of vereist dure, tijdrovende hertraining. Daarom stellen wetenschappers een grote vraag: is er een manier om een slechte afbeelding te repareren nadat deze is gemaakt, zonder de rest van de afbeelding te beschadigen? Het is alsof je een magische gum hebt die een specifelijk ongewenst object uit een foto kan verwijderen zonder de prachtige zonsondergang erachter te vegen.
Maak kennis met ReVision, een nieuwe techniek voorgesteld door onderzoeker Gurjot Singh en zijn team. Zie ReVision als een superintelligente nabewerker die fungeert als een "veiligheidsnet" voor door AI gegenereerde afbeeldingen. In plaats van te proberen de AI te stoppen om fouten te maken in de eerste plaats, wacht ReVision tot de afbeelding klaar is, bekijkt deze, en verwijdert chirurgisch de "onacceptabele" delen terwijl de rest perfect intact blijft.
De onderzoekers ontdekten dat eerdere "veiligheid-editors" vaak een lomp probleem hadden: ze waren als een penseel die te groot was. Als je probeerde een slechte jongen in een menigte over te schilderen, zou de penseel per ongeluk ook de onschuldige omstanders naast hem overschilderen, waardoor de hele scène werd verpest. Dit gebeurde omdat de computer in de war raakte over precies welk object het moest repareren.
ReVision lost dit op met een slimme tweestaps-truc. Eerst gebruikt het een "Vision-Language Model" (een type AI dat zowel afbeeldingen als woorden begrijpt) om als een detective te fungeren. Deze detective bekijkt de afbeelding en zegt: "Aha! Ik zie hier een beroemdheid, en ik zie daar een wapen." Cruciaal is dat de detective niet alleen gokt; hij tekent een nauwkeurige, onzichtbare box rond het slechte ding, zoals een beveiligingsbeambte die precies naar de boef wijst.
Ten tweede gebruikt ReVision een "spatial gating" mechanisme (ruimtelijke poortwerking). Stel je het bewerkingsproces voor als een vloed aan water die probeert het slechte concept weg te spoelen. Zonder de poort zou het water over de rand kunnen gaan en de hele kamer overstromen. Maar ReVision boude een dam rond de onzichtbare box die de detective heeft getekend. Nu kan het "water" (de bewerkingsmagie) alleen binnen die box stromen. Het vervangt het slechte concept door een veilig concept—zoals een naakt persoon veranderen in iemand met kleding, of een beroemde acteur in een willekeurige vreemde—zonder de persoon die ernaast staat aan te raken.
Het team testte dit op een enorme set van 800 afbeeldingen, inclus_ief lastige scènes met meerdere mensen en objecten. De resultaten waren indrukwekkend. Toen ze probeerden "naakt" content te verwijderen, elimineerde ReVision alle detecties van naaktheid (een daling van 70,51 detecties naar 0), terwijl oudere methoden vaak sporen achterlieten of per ongeluk de kleding van onschuldige mensen in de buurt veranderden. In tests met meerdere concepten verminderde ReVision de "ruis" of ongewenste veranderingen in de achtergrond van 0,166 naar 0,058, een enorme verbetering in het natuurlijk houden van de rest van de afbeelding.
Misschien wel de meest veelzeggende test was een menselijke studie. Wanneer mensen naar de originele, onveilige afbeeldingen keken, konden ze de schadelijke inhoud in 96% van de gevallen herkennen. Nadat ReVision zijn werk had gedaan, konden mensen de onacceptabele inhoud slechts in 10% van de gevallen herkennen. Nog beter: de mensen in de "veilige" delen van de afbeelding werden niet per ongeluk aangepast.
De onderzoekers benadrukken dat deze methode "training-vrij" is, wat betekent dat het niet nodig is om opnieuw te leren hoe te tekenen of dat het oorspronkelijke AI-bedrijf zijn code moet aanpassen. Het werkt als een universele toevoeging, klaar om door iedereen te worden geïnstalleerd die wil zorgen dat hun AI-afbeeldingen veilig zijn. Hoewel de studie suggereert dat dit een grote stap voorwaarts is, merken de auteurs op dat hun testafbeeldingen specif kind voor dit experiment zijn gemaakt, en toekomstig werk zal moeten verifiëren hoe goed dit werkt in elke mogelijke echte scenario. Maar voor nu biedt ReVision een veelbelovende, precieze manier om de magie van AI-kunst te behoeden voor een nachtmerrie, zodat we bij het wegwassen van het slechte, niet per ongeluut het goede wissen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.