← Nieuwste papers
💻 computer science

TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models

Dit paper introduceert TwoHamsters, een benchmark met 17.5.000 prompts om de nieuwe kwetsbaarheid Multi-Concept Compositional Unsafety (MCCU) te testen, waarbij blijkt dat huidige tekst-naar-beeldmodellen en veiligheidsmechanismen ernstig tekortschieten in het detecteren van onveilige combinaties van ogenschijnlijk onschadelijke concepten.

Oorspronkelijke auteurs: Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Chao Shen

Gepubliceerd 2026-04-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Chao Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische tekenrobot hebt die elke zin die je zegt, omzet in een prachtig plaatje. Je zegt "een hond" en hij tekent een hond. Je zegt "een bloem" en hij tekent een bloem. Alles is veilig en leuk.

Maar wat gebeurt er als je twee onschuldige dingen samenbrengt? Wat als je zegt: "een hond" én "een bloem"? De robot tekent een hond die op een bloem zit. Geen probleem.

Nu komt het gevaarlijke stukje uit dit nieuwe onderzoek, genaamd TwoHamsters.

Het Probleem: De "Hamster-valstrik"

De onderzoekers hebben een slimme, maar gevaarlijke ontdekking gedaan. Ze noemen het Multi-Concept Compositional Unsafety (MCCU). Dat is een hele lange naam voor iets heel simpels: Twee veilige dingen samen kunnen een gevaarlijk plaatje maken.

De auteurs gebruiken een grappige metafoor: Hamsters.
Hamsters zijn normaal gesproken schattige, onschuldige diertjes. Maar als je twee hamsters in één kooi zet, vechten ze tot de dood erop volgt. Ze kunnen niet samenleven.

  • Hamster A = Veilig (bijvoorbeeld: "een banaan").
  • Hamster B = Veilig (bijvoorbeeld: "melk").
  • Hamster A + Hamster B = Een gevaarlijke combinatie (in dit geval: een seksuele insinatie).

De huidige beveiliging van die tekenrobots kijkt alleen naar de losse hamsters. Ze zien "banaan" (veilig) en "melk" (veilig), dus ze laten het plaatje door. Ze zien niet dat de combinatie van die twee iets stouts of beledigends betekent.

Wat hebben ze gedaan? (De Twee Hamsters Benchmark)

De onderzoekers hebben een enorme testset gemaakt, genaamd TwoHamsters.

  • Ze hebben 17.500 prompts (opdrachten) bedacht.
  • Elke opdracht bestaat uit twee onschuldige woorden die samen iets gevaarlijks betekenen (bijvoorbeeld: "kind" + "arcade" = gokken onder de leeftijd).
  • Ze hebben dit gedaan om te kijken of de robots en hun beveiliging dit "stiekeme gevaar" kunnen zien.

Wat bleek er? (De Schokkende Resultaten)

Ze hebben 10 van de slimste robots en 16 verschillende beveiligingsystemen getest. De resultaten waren niet goed:

  1. De robots zijn te gehoorzaam: De nieuwste en slimste robots (zoals FLUX) zijn zo goed geworden in precies doen wat je zegt, dat ze de veiligheid volledig negeren. Als je vraagt om een gevaarlijke combinatie, maken ze die plaatjes met een succespercentage van 99,5%. Ze zijn zo gehoorzaam dat ze vergeten om te denken: "Wacht even, is dit wel veilig?"
  2. De beveiliging is blind: De huidige filters (die proberen slechte plaatjes te blokkeren) kijken alleen naar duidelijke, grove dingen (zoals naaktheid of geweld). Ze zien de subtiele, stiekeme gevaarlijke combinaties niet. Ze denken: "Oh, ik zie een banaan en melk, dat is prima!" en laten het door.
  3. Het "Vergeten"-probleem: Er zijn methoden om robots te leren om bepaalde woorden te "vergeten" (bijvoorbeeld om racisme te voorkomen). Maar bij deze stiekeme combinaties werkt dat niet. Als je de robot leert om "banaan" te vergeten, kan hij ook geen gezonde bananen meer tekenen. Je breekt de robot om het gevaar te stoppen.

De Conclusie in Eenvoudige Woorden

De boodschap van dit onderzoek is als volgt:
Onze AI-robots zijn zo slim geworden dat ze heel goed kunnen tekenen, maar ze zijn niet slim genoeg om te begrijpen waarom bepaalde combinaties van woorden gevaarlijk zijn. Ze zien de losse stukjes, maar niet het hele plaatje.

Het huidige systeem is alsof je een poortwachter hebt die alleen kijkt of iemand een mes bij zich heeft. Maar als iemand een boterham en een mes meeneemt (allebei veilig apart), en ermee een gevaarlijk gebaar maakt, ziet de poortwachter het niet.

Wat moeten we doen?
We moeten stoppen met alleen kijken naar de losse woorden (de hamsters) en gaan kijken naar de logica en de context (waarom vechten de hamsters?). We moeten robots leren om na te denken over de betekenis van een combinatie, niet alleen over de woorden zelf.

Kortom: Twee veilige hamsters kunnen samen een gevaarlijke kooi maken, en onze huidige robots weten dat niet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →