Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
Dit artikel introduceert Omni-SafetyBench, de eerste uitgebreide parallelle benchmark met 23.328 audio-visuele testgevallen en gespecialiseerde metrieken om ernstige veiligheids kwetsbaarheden en cross-modale inconsistenties in huidige Omni-modale Large Language Models te onthullen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de snel evoluerende wereld van kunstmatige intelligentie is een nieuwe generatie systemen opgekomen die tegelijkertijd kunnen zien, horen en lezen. In tegenstelling tot eerdere modellen die alleen tekst verwerkten of afbeeldingen in isolatie, zijn deze omnimodale systemen ontworpen om de rijke, chaotische realiteit van menselijke communicatie te begrijpen, waarbij een gesproken waarschuwing een gevaarlijk beeld kan vergezellen, of een stemcommando geïnterpreteerd moet worden naast een video. Hoewel dit vermogen om meerdere zintuigen te synthetiseren krachtige nieuwe hulpmiddelen belooft, introduceert het ook een complexe reeks risico's. Als een machine niet betrouwbaar het onderscheid kan maken tussen een onschuldige beschrijving van een gereedschap en een echt instructie om een wapen te bouwen, kunnen de gevolgen ernstig zijn. De centrale uitdaging voor ontwikkelaars is niet alleen om deze systemen slim te maken, maar om ervoor te zorgen dat ze veilig blijven bij elke mogelijke combinatie van zicht, geluid en tekst.
Een team van onderzoekers heeft nu een rigoureuze testomgeving gebouwd om precies te meten hoe goed deze systemen dergelijke gevaren afhandelen. Ze creëerden een enorme collectie testgevallen genaamd Omni-SafetyBench, die kunstmatige intelligentiemodellen presenteert met 23.328 verschillende scenario's. Deze scenario's zijn niet willekeurig; het zijn zorgvuldig geconstrueerde variaties van 972 kernachtige schadelijke ideeën, zoals instructies voor het maken van wapens of het plegen van fraude. De onderzoekers namen elk schadelijk idee en transformeerden het naar elk mogelijk formaat: als platte tekst, als een afbeelding, als een video, als audio, en in elke combinatie van deze, inclusief complexe mengsels van video, geluid en tekst tegelijkertijd. Deze aanpak stelde hen in staat om te zien of een model een gevaarlijk verzoek zou weigeren wanneer het verscheen als een eenvoudige zin, maar dan zou falen om hetzelfde gevaar te herkennen wanneer het werd gepresenteerd als een video met een voice-over.
De resultaten van deze test onthullen een verontrustend patroon. Wanneer de onderzoekers elf van de meest geavanceerde beschikbare modellen evalueerden, ontdekten ze dat de veiligheidsprestaties scherp dalen naarmate de inputs complexer worden. Een model kan een tekstuele aanvraag om een bom te bouwen succesvol weigeren, maar volledig falen wanneer diezelfde aanvraag wordt geleverd via een video- en audioclip. Sterker nog, voor de meeste van de geteste modellen bleek de combinatie van audio- en visuele informatie de meest effectieve manier om de veiligheidsverdediging van de modellen te omzeilen. Slechts drie modellen slaagden erin om een hoog niveau van veiligheid te handhaven over al deze verschillende formaten, en zelfs die toppresteerders vertoonden aanzienlijke zwakheden wanneer ze werden geconfronteerd met de meest ingewikkelde combinaties van inputs. De studie suggereert dat huidige veiligheidsmaatregelen vaak fragiel zijn; ze werken goed in eenvoudige situaties, maar bezwijken onder de druk van multisensorische inputs.
Om te begrijpen waarom dit gebeurt, keken de onderzoekers nauwgezet naar hoe de modellen informatie verwerken. Ze ontdekten dat een groot probleem niet alleen is dat de modellen niet in staat zijn om "nee" te zeggen, maar dat ze soms de input helemaal niet begrijpen. Als een model een complexe mix van video en geluid niet kan begrijpen, kan het per ongeluk een schadelijk antwoord genereren simpelweg omdat het in de war is, niet omdat het kwaadwillend is. De onderzoekers ontwikkelden een nieuwe manier om veiligheid te scoren die hiervan rekening houdt, door een onderscheid te maken tussen een model dat een gevaarlijk verzoek begrijpt en weigert, en een model dat het verzoek niet begrijpt en per ongelage het antwoord geeft. Dit onderscheid is cruciaal, omdat een hoge veiligheidsscore gebaseerd op verwarring geen echte veiligheid is.
De studie testte ook of bestaande methoden om deze modellen veiliger te trainen deze problemen konden oplossen. Ze probeerden twee hoofdaanpakken: het aanpassen van het gedrag van het model terwijl het werkt (inference-time alignment) en het hertrainen van het model met nieuwe data (post-training alignment). De resultaten toonden aan dat het aanpassen van het model terwijl het werkt slechts tijdelijke verlichting biedt en het onderliggende probleem niet oplost. Het hertrainen van het model met veiligere data hielp, maar creëerde een nieuw probleem: de modellen werden goed in het afhandelen van de specifieke soorten data waarop ze waren getraind, maar bleven kwetsbaar voor elke nieuwe combinatie van inputs die ze niet hadden gezien. Dit suggereert dat het simpelweg toevoegen van meer data niet genoeg is; de modellen moeten een dieper, flexibeler begrip van veiligheid leren dat van toepassing is, ongeacht hoe de informatie wordt gepresenteerd.
Uiteindelijk benadrukt dit onderzoek een kritieke kloof in de ontwikkeling van kunstmatige intelligentie. Naarmate deze systemen meer geïntegreerd raken in ons dagelijks leven, waarbij ze alles afhandelen van stemassistenten tot videoanalyse-tools, moet hun veiligheid robuust zijn over alle vormen van communicatie. De bevindingen wijzen erop dat huidige veiligheidsstandaarden onvoldoende zijn voor de complexiteit van interacties in de echte wereld. De onderzoekers concluderen dat zonder significante vooruitgang in hoe deze modellen worden getraind en geëvalueerd, ze kwetsbaar zullen blijven voor aanvallen die de functies exploiteren die hen juist zo krachtig maken: hun vermogen om te zien, te horen en de wereld in al haar vormen te begrijpen. Dit werk biedt een duidelijk stappenplan voor wat er nu moet gebeuren, en dringt aan om het veld verder te laten gaan dan eenvoudige tekstgebaseerde veiligheidscontroles en systemen te ontwikkelen die werkelijk veilig zijn in een multisensorische wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.