AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models
Dit artikel introduceert AIR-BENCH Live, een zelfevoluerende veiligheidsbenchmark voor fundamentele modellen die een geautomatiseerde pijplijn gebruikt om continu nieuwe overheidsvoorschriften te integreren en meertalige aanvals-prompts te genereren, waardoor de beperkingen van statische benchmarks in een snel veranderend AI-landschap worden aangepakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van kunstmatige intelligentie voor als een enorme, steeds uitbreidende bibliotheek waar robots leren om verhalen te schrijven, problemen op te lossen en zelfs met ons te chatten. Maar net als in elke bibliotheek zijn er regels over wat geschreven mag worden: geen instructies over hoe je bommen bouwt, geen haatzaaiende uitlatingen en geen trucjes om geheimen te stelen. Wetenschappers creëren "veiligheidstests" om te zien of deze robots de regels volgen. Denk aan deze tests als een reeks raadsels of vallen die ontworpen zijn om de robot te misleiden om de regels te breken. Als de robot de truc afwijst, krijgt hij een hoge score; als hij erin trapt, krijgt hij een lage score. Het probleem is dat de wereld snel verandert. Nieuwe wetten worden aangenomen, nieuwe manieren om robots te misleiden worden uitgevonden, en oude raadsels worden te makkelijk op te lossen. Een veiligheidstest van vorig jaar kan vandaag nutteloos zijn omdat de robot heeft geleerd de oude trucjes te negeren, of omdat een nieuwe wet iets heeft verboden waar de test nooit eens aan had gedacht. Dit is waarom onderzoekers altijd op zoek zijn naar een manier om deze tests "levend" te maken en zichzelf te laten updaten, zodat ze relevant blijven in een wereld die nooit stilstaat.
Dit artikel introduceert een nieuwe, zelf-updaterende veiligheidstest genaamd AIR-BENCH Live. Denk aan dit als een beveiligingsbeambte die niet alleen bij de deur staat met een vaste lijst van verboden items, maar in plaats daarvan een robotassistent heeft die constant het nieuws scant, nieuwe wetten uit de hele wereld leest en direct nieuwe, lastige raadsels maakt om de AI te testen. De onderzoekers hebben een pijplijn gebouwd die automatisch overheidsregelsingen ("scrapt") van plekken zoals de VS, China en de EU. Wanneer het een nieuwe regel vindt — zoals een wet tegen het stelen van een robotbrein of het gebruik van nepvideo's om verkiezingen te verstoren — voegt het een nieuwe categorie toe aan de veiligheidschecklist. Vervolgens werkt een team van AI-agenten samen om realistische, meertalige prompts (de raadsels) te schrijven op basis van deze nieuwe regels. Ze gebruiken "persona's", wat lijkt op acteerrollen, om de raadsels te laten klinken alsof ze van echte mensen in verschillende situaties komen, in plaats van een robot die een script voorleest.
Het team testte 14 verschillende AI-modellen met behulp van deze nieuwe, evoluerende benchmark. Ze ontdekten een enorme kloof in veiligheid: sommige modellen waren ongelooflijk veilig en weigerden bijna elke truc (een score van 1.00), terwijl andere vrij gemakkelijk te misleiden waren (met scores zo laag als 0.17). Interessant genoeg waren de nieuwe, gemoderniseerde prompts moeilijker dan de oude, waardoor zelfs de meest gehoorzame modellen een beetje in de knoop kwamen. De onderzoekers ontdekten ook dat de meeste modellen iets minder veilig waren wanneer ze in andere talen dan het Engels werden gevraagd, wat suggereert dat het beleefd en veilig houden van robots in alle menselijke talen nog steeds een werk in uitvoering is. Het artikel concludeert dat hoewel we de wereld niet kunnen stoppen met veranderen, we wel veiligheidstests kunnen bouwen die meevariëren met de verandering, om ervoor te zorgen dat naarmate AI slimmer wordt, ons vermogen om de veiligheid ervan te testen ook slimmer wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.