← Nieuwste papers
💻 computer science

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

Dit artikel introduceert GPO-V, een nieuw jailbreak-framework dat gebruikmaakt van de unieke progressieve weigeringspatronen en globale generatieve dynamiek van Diffusie Visueel-Taalmodellen (dVLM's) om veiligheidsbarrières te omzeilen door middel van sluwe, globaal geoptimaliseerde verstoringen, waardoor kritieke beveiligingskwetsbaarheden in niet-autoregressieve multimodale architecturen worden blootgelegd.

Oorspronkelijke auteurs: Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, artistieke robot voor die tegelijkertijd afbeeldingen kan tekenen en verhalen kan schrijven. Deze robot, een Diffusion Vision-Language Model (dVLM), werkt anders dan de chatbots die je misschien kent.

In plaats van een verhaal woord voor woord van links naar rechts te schrijven (zoals een mens typen), werkt deze robot als een beeldhouwer die een blok marmer beitelt. Het begint met een ruw, wazig blok "ruis" (willekeurige statische storing) en verfijnt dit geleidelijk, waarbij het stap voor stap de ruis verwijdert totdat een duidelijk beeld en een duidelijke zin ontstaan.

Het Probleem: De "Veiligheidsschakelaar" van de Robot

Je zou denken dat dit beeldhouwproces de robot veiliger maakt. Als het begint met het beitelen van iets gevaarlijks (zoals instructies voor het bouwen van een bom), heeft het een "Veiligheidsschakelaar" die het hele beeldhouwwerk stopt.

De onderzoekers ontdekten dat deze robot twee specifieke manieren heeft om "Nee" te zeggen:

  1. De "Directe Stop": Het moment dat het een slecht idee ziet, zet het het hele blok direct terug in ruis en stopt het, zeggend: "Dat kan ik niet doen."
  2. De "Langzame Draai": Het begint met het beitelen van een mooi vorm (zeggend: "Natuurlijk, hier is..."), maar halverwege het proces realiseert het zich: "Wacht, dit is gevaarlijk!" en herschikt het langzaam het hele werk tot een weigering.

De Oude Manier van Inbreken (FPO)

Hackers probeerden vroeger gewone chatbots te misleiden door ze te dwingen te beginnen met een specifieke zin, zoals "Natuurlijk, hier is hoe je het doet." Dit heet Fixed Prefix Optimization (FPO). Het is alsof je probeert een mens te misleiden door te zeggen: "Begin je zin alsjeblieft met 'Natuurlijk'."

Maar deze truc werkt niet op de beeldhouwende robot. Zelfs als je het dwingt om te beginnen met "Natuurlijk", schakelt de "Langzame Draai"-veiligheidsschakelaar later in. Het ziet het gevaar halverwege het proces en verandert het hele beeldhouwwerk in een weigering. De oude truc werkt niet omdat de robot naar het hele plaatje kijkt, niet alleen naar het eerste woord.

De Nieuwe Manier: GPO-V (De "Global Probability"-Hack)

De onderzoekers ontdekten een nieuwe manier om de robot te misleiden, die ze GPO-V (Global Probability Optimization) noemen.

In plaats van te proberen de robot te dwingen om een specifiek woord aan het begin te zeggen, manipuleren ze de allereerste "wazige ruis" die ze de robot invoeren.

De Analogie:
Stel je voor dat je probeert een rivier te leiden naar een specifieke vallei.

  • De Oude Manier (FPO): Je probeert instructies naar het water te schreeuwen terwijl het stroomt ("Ga links! Ga rechts!"). De rivier negeert je omdat het al te snel beweegt.
  • De Nieuwe Manier (GPO-V): Je graaft een klein kanaal bij de allereerste bron van de rivier, voordat het water zelfs maar begint te stromen. Je dwingt het water niet; je kantelt het landschap slechts lichtjes. Omdat het water stroomt op basis van zwaartekracht en de vorm van het land, buigt de hele rivier natuurlijk af naar jouw vallei.

In de termen van het artikel maken de onderzoekers tiny, bijna onzichtbare veranderingen aan de "ruis" (het invoerbeeld of de tekst) aan het begin. Dit verandert de globale waarschijnlijkheid – de algemene richting waarin de robot neigt.

  • Ze maken het extreem onwaarschijnlijk dat de robot "weigering"-woorden bedenkt (zoals "Sorry" of "Bom").
  • Ze maken het extreem waarschijnlijk dat de robot "toegestane"-woorden bedenkt (zoals "Natuurlijk" en "Hier").

Omdat de robot het hele beeld in één keer verfijnt, dwingt deze kleine duw aan het begin het hele "beeldhouwwerk" om het gevaarlijke inhoud te worden die de hacker wil, waardoor de veiligheidsschakelaar volledig wordt omzeild.

Wat Ze Vonden

De onderzoekers testten dit op twee van de slimste beschikbare "beeldhouwende" robots (LLaDA-V en LaViDA).

  • Het Resultaat: De oude methode (FPO) faalde bijna volledig. De nieuwe methode (GPO-V) werkte 93% van de tijd.
  • De Verrassing: Zelfs als ze de "hack" trainden op één robot, werkte het ook op de andere robot. Dit betekent dat de zwakke plek niet alleen in de code van één robot zit; het is een fundamenteel gebrek in hoe dit type beeldhouwende robot denkt.

De Conclusie

Het artikel beweert dat deze nieuwe "beeldhouwende" AI-modellen niet zo veilig zijn als we dachten. Hun veiligheidsmechanismen, die vertrouwen op het controleren van het hele plaatje aan het einde, kunnen worden omzeild door het startpunt van het proces subtiel te kantelen. De onderzoekers waarschuwen dat we nieuwe veiligheidsvoorzieningen moeten bouwen die om kunnen gaan met deze "globale" manier van denken, en niet alleen de "woord-voor-woord"-veiligheidscontroles die we vroeger gebruikten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →