← Nieuwste papers
🤖 AI

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

Dit artikel introduceert Adaptive View Retrieval, een nieuw framework dat bestaande multimodale veiligheidssystemen aanzienlijk overtreft in het detecteren van verborgen haatdragende illusies door de taak te formuleren als een perceptueel ophaalprobleem dat de verduisterde betekenissen herstelt voordat de schadelijkheid ervan wordt beoordeeld.

Oorspronkelijke auteurs: Qianpu Chen, Derya Soydaner

Gepubliceerd 2026-07-22
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qianpu Chen, Derya Soydaner

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je door een digitale kunstgalerie loopt waar de muren vol hangen met afbeeldingen. De meeste van deze plaatjes zijn onschadelijk, maar sommige zijn verraderlijk. Ze zien eruit als een normale scène — een bos, een straat in de stad, of een patroon van letters — maar als je je ogen een beetje dichtknijpt of vanuit een andere hoek kijkt, verschijnt er een geheime boodschap. Dit is de wereld van optische illusies, een vakgebied dat onderzoekt hoe onze hersenen (en computers) soms in de strik kunnen worden gelokt door wat ze zien. Al een lange tijd weten wetenschappers dat computers slecht zijn in het herkennen van deze trucs; ze zien vaak de "oppervlakte" van de afbeelding, maar missen de verborgen laag eronder.

Stel je nu voor dat iemand dezezelfde trucs gebruikt om iets gevaarlijks te verbergen, zoals een haatsymbool of een beledigende term, binnenin een afbeelding die er volkomen onschuldig uitziet. Dit is een groot probleem voor de "beveiligingsbewakers" van het internet — AI-systemen die ontworpen zijn om schadelijke inhoud te scannen en te stoppen. Als de beveiligingsbewaker alleen naar de oppervlakte van de afbeelding kijkt, kan hij een gevaarlijk geheim zo gemakkelijk voorbij laten glippen. Dit paper pakt precies dat gat aan: hoe leren we computers om niet alleen naar het oppervlak van een afbeelding te kijken, maar om op zoek te gaan naar de verborgen waarheid voordat ze beslissen of een plaatje veilig is of niet?

Het Probleem: De "Onzichtbare" Haat

De onderzoekers ontdekten dat de huidige AI-veiligheidssystemen spectaculair falen bij het opsporen van deze verborgen gevaren. Wanneer zij zes verschillende veiligheidsclassificaties testten op afbeeldingen met verborgen haat, kreeg de beste slechts ongeveer 20,9–24,5% van hen correct geïdentificeerd. Zelfs de meest geavanceerde, state-of-the-art AI-modellen (de "superintelligente" modellen) die speciale hints over de listigheid kregen, hadden nog steeds moeite en scoorden op of onder de 10,2%.

Denk er maar eens zo over na: als je een beveiligingsbewaker een foto van een vredig park geeft, maar er zit een piepklein, onzichtbaar graffiti-teken verborgen in de wolken, dan zegt de bewaker: "Alles veilig!" Het probleem is dat de bewaker alleen naar het park kijkt, niet naar de wolken. Het paper betoogt dat de huidige aanpak lijkt op het proberen op te lossen van een puzzel door alleen naar de afbeelding op de doos te staren, in plaats van de doos te openen. De verborgen boodschap is er wel, maar de "ogen" van de computer zijn gefixeerd op het verkeerde perspectief.

De Oplossing: Een Detective met Veel Verschillende Brillen

Om dit op te lossen, stellen de auteurs een nieuwe methode voor genaamd Adaptive View Retrieval. In plaats van de computer te dwingen om de verborgen boodschap in de originele afbeelding te zien, geven ze de computer een "gereedschapskist" met verschillende manieren om naar de afbeelding te kijken.

Stel je voor dat je een specifieke sleutel probeert te vinden in een rommelige kamer. Je zou kunnen proberen te kijken met het licht aan, en dan met een zaklamp, of door in het donker te voelen, of misschien door naar de kamer te kijken door een rood filter. Sommige sleutels zijn alleen zichtbaar onder de zaklamp; andere zijn alleen zichtbaar wanneer je de vorm voelt. Adaptive View Retrieval doet precies dit voor afbeeldingen. Het creëert een "view bank" van zeven verschillende versies van dezelfde afbeelding:

  1. De Original View (de normale afbeelding).
  2. Een Contrast-Enhanced View (het laten opvallen van schaduwen en licht).
  3. Een Closure-Edge View (het benadrukken van contouren en lijnen, als een schets).
  4. Drie Figure-Ground Views (het scheiden van het "object" van de "achtergrond" om te zien wat er in de voorgrond verborgen zit).
  5. Een Low-Pass View (het vervagen van de kleine details om de grote, grove vormen te zien).

De magie zit hem niet alleen in het hebben van deze verschillende weergaven; het zit erin dat de computer leert welke weergave hij moet vertrouwen voor elke specifieke afbeelding. Het is als een slimme detective die weet dat hij voor deze aanwijzing een zaklamp nodig heeft, maar voor die aanwijzing een rood filter. Het systeem gokt niet zomaar; het "roept" de best passende weergave op uit een bibliotheek van bekende verborgen boodschappen (zoals een database van haatsymbolen) en controleert vervolgens of die teruggevonden boodschap schadelijk is.

De Resultaten: De Code Kraken

Wanneer de onderzoekers dit nieuwe "detective"-systeem testten op een dataset genaamd HatefulIllusion, waren de resultaten een enorme sprong voorwaarts. Terwijl de oude methoden faalden, behaalde dit nieuwe systeem een gebalanceerde nauwkeurigheid van 93,2%. Dat betekent dat het de verborgen haat in bijna elk geval succesvol vond, waarmee het de vorige beste pogingen ver overtrof.

Het paper toonde ook aan dat deze methode niet alleen voor haatspraak is. Wanneer ze het testten op andere soorten visuele puzzels (zoals het vinden van verborgen getallen of dieren in afbeeldingen), evenaarden of versloegen ze zelfs de menselijke prestaties. Het werkte ook beter dan andere methoden die simpelweg proberen "uit te zoomen" op een afbeelding om het grote plaatje te zien.

Waarom Dit Belangrijk Is

De belangrijkste les van dit paper is een verschuiving in hoe we over veiligheid denken. De auteurs stellen dat je niet kunt beslissen of een afbeelding gevaarlijk is totdat je de verborgen betekenis hebt teruggevonden. Je kunt niet alleen naar het oppervlak kijken en gokken. Door een systeem te bouteren dat actief op zoek gaat naar de verborgen laag met de juiste "lens" voor de klus, kunnen we eindelijk de kwaadwillenden vangen die proberen onopgemerkt te blijven.

Het paper sluit expliciet de mogelijkheid uit dat een enkel, vast filter (zoals het simpelweg vervagen van de afbeelding of het verhogen van het contrast) de oplossing is. Ze lieten zien dat geen enkele truc werkt voor elke illusie. In plaats daarvan is de oplossing aanpassingsvermogen — het laten kiezen van de AI voor de beste tool voor de specifieke taak. Dit is geen toverstaf die elk veiligheidsprobleem op internet oplost, maar het is een krachtige nieuwe strategie die bewijst dat we moeten veranderen hoe we naar afbeeldingen kijken, en niet alleen waar we naar zoeken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →