← Nieuwste papers
🤖 AI

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe introduceert een op bewijs gebaseerd framework en benchmark (EviSafeBench) die de veiligheid van Vision-Language Models evalueert door niet alleen de uiteindelijke reacties te beoordelen, maar ook het vermogen van het model om beslissingen correct te funderen in visuele/tekstuele bewijslast en zich aan te passen aan contrafactische veranderingen, wat onthult dat huidige modellen vaak niet veilig zijn om de juiste multimodale redenen.

Oorspronkelijke auteurs: Xuetong Li, Gaofeng Liu

Gepubliceerd 2026-08-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xuetong Li, Gaofeng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie is een nieuwe generatie computerprogramma's opgekomen die tegelijkertijd kunnen zien en lezen. Deze systemen, bekend als vision-language modellen, bekijken een afbeelding en lezen de tekst die een persoon typt, en combineren vervolgens die twee informatiestromen om vragen te beantwoorden of advies te geven. Ze worden steeds vaker gebruikt om medische scans te interpreteren, juridische documenten te analyseren en complexe sociale scènes te navigeren. Omdat deze hulpmiddelen invloed kunnen hebben op beslissingen in de echte wereld, is het waarborgen van hun veiligheid een kritieke prioriteit. Jarenlang hebben onderzoekers deze systemen getest door ze gevaarlijke vragen te stellen en te controleren of de computer weigert te antwoorden. Als de machine "nee" zegt of een waarschuwing geeft, wordt dit als veilig beschouwd. Als de machine de vraag direct beantwoordt, wordt dit als onveilig beschouwd. Deze methode kijkt echter alleen naar het eindresultaat, vergelijkbaar met een leraar die een essay van een leerling beoordeelt door alleen naar de conclusie te kijken zonder de redenering te lezen die tot die conclusie leidde. Een computer kan een verzoek weigeren simpelweg omdat hij één eng woord heeft opgemerkt, of hij kan een gevaarlijk antwoord geven omdat hij een cruciaal detail in de afbeelding heeft gemist. De vraag blijft: wanneer een machine veilig lijkt, is hij dan ook echt veilig om de juiste redenen?

Een team van onderzoekers aan de Shanghai Jiao Tong Universiteit heeft een nieuwe manier ontwikkeld om deze systemen te testen die dieper graaft dan het uiteindelijke antwoord. Ze creëerden een framework genaamd EviSafe, dat veiligheid niet alleen behandelt als een pass of fail op de uiteindelijke output, maar als een proces van het vinden en gebruiken van het juiste bewijs. Stel je een beveiligingsbeambte voor die een persoon bij een poort tegenhoudt. Een eenvoudige test vraagt alleen of de beambte de persoon heeft tegengehouden. De nieuwe test vraagt of de beambte hen tegenhield omdat hij een wapen zag, omdat hij een specifieke dreiging herkende, of simpelweg omdat de persoon een rode hoed droeg. De onderzoekers bouwden een enorme collectie van 1.181 zorgvuldig geconstrueerde scenario's, elk met een afbeelding en een vraag, samen met een gedetailleerde kaart van waar de computer naar zou moeten kijken om de juiste beslissing te nemen. Ze creëerden ook meer dan 2.400 variaties van deze scenario's waarbij ze slechts één klein stukje bewijs veranderden, zoals het verwijderen van een gevaarlijk object uit de foto of het veranderen van een woord in de vraag, om te zien of het gedrag van de computer dienovereenkomstig veranderde.

De onderzoekers testten elf verschillende vision-language modellen met deze nieuwe methode. Ze stelden elk model drie soorten vragen voor elk scenario. Ten eerste vroegen ze het model om de vraag natuurlijk te beantwoorden, precies zoals een gebruiker dat zou doen. Ten tweede vroegen ze het model om zijn redenering uit te leggen door te wijzen op de specifieke tekstuele en visuele aanwijzingen die het gebruikte om tot zijn beslissing te komen. Ten derde presenteerden ze het model met de aangepaste scenario's om te zien of het zijn antwoord kon aanpassen wanneer het bewijs veranderde. De resultaten onthulden een aanzienlijke kloof tussen er veilig uitzien en daadwerkelijk veilig zijn. Hoewel sommige modellen aan de oppervlakte redelijk presteerden, met een natuurlijke veiligheidsnauwkeurigheid variërend van ongeveer 28 tot 53 procent, was hun vermogen om het bewijs achter hun beslissingen correct te identificeren en te rapporteren veel lager. In feite werd slechts een klein deel van de model-scenario-records, namelijk 9,8 procent, gelabeld als een op bewijs gebaseerd succes, wat betekent dat het model het juiste uiteindelijke antwoord gaf en tegelijkertijd het specifieke visuele of tekstuele bewijs correct identificeerde dat dat antwoord rechtvaardigde.

De studie toonde aan dat veel modellen in essentie gokken of vertrouwen op shortcuts. Een computer kan een verzoek weigeren omdat hij een trefwoord ziet dat geassocieerd wordt met gevaar, zelfs als de afbeelding een onschuldige context toont, zoals een arts die een medische procedure uitlegt. Omgekeerd kan een model een gevaarlijk antwoord geven omdat het een cruciaal detail in de afbeelding niet opmerkt dat het verzoek onveilig maakt. Wanneer de onderzoekers het bewijs in de testscenario's veranderden, faalden veel modellen erin hun gedrag aan te passen. Bijvoorbeeld, als een gevaarlijk object uit een afbeelding werd verwijderd, zou een werkelijk veilig model zijn antwoord moeten veranderen van een waarschuwing naar een veilig antwoord. Echter, de tests toonden aan dat slechts ongeveer 30 tot 58 procent van de modellen deze overstap succesvol maakte. Dit suggereert dat deze systemen niet betrouwbaar de relatie begrijpen tussen wat ze zien en wat ze zeggen. Ze reageren vaak op oppervlakkige patronen in plaats van een samenhangend begrip van de situatie op te bouwen.

De onderzoekers ontdekten ook dat de grootte van het model het probleem niet noodzakelijkerwijs oplost. Grotere, krachtigere modellen presteerden niet consistent beter in het leggen van de connectie tussen de afbeelding en de tekst. Sommige van de grootste modellen konden de risicofactoren correct identificeren wanneer daarom werd gevraagd om ze in een gestructureerd rapport uit te leggen, maar ze faalden nog steeds in het veilig handelen bij het beantwoorden van dezelfde vraag in een natuurlijke conversatie. Dit duidt op een disconnect tussen het vermogen van het model om bewijs te analyseren en het vermogen om die analyse te gebruiken om zijn gedrag te sturen. De studie concludeert dat de huidige generatie vision-language modellen nog niet veilig is om de juiste redenen. Ze lijken misschien per ongeluk veilig te zijn, of ze zijn onveilig op manieren die verborgen blijven door eenvoudige weigeringstests. Om werkelijk betrouwbare systemen te bouwen, zullen ontwikkelaars verder moeten kijken dan het tellen hoe vaak een model een verzoek weigert en moeten beginnen met het trainen van deze modellen om hun beslissingen te funderen in het feitelijke bewijs dat aanwezig is in de afbeelding en de tekst, om ervoor te zorgen dat hun veiligheid gebaseerd is op begrip in plaats van toeval.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →