Multi-Agent LLMs as Ethics Advocates for AI-Based Systems
Dit artikel stelt een multi-agent LLM-framework voor en evalueert dit, dat een ethische pleitbezorger-agent bevat die effectief ethische vereisten voor AI-systemen opstelt, hoewel het de voortdurende noodzaak van menselijk toezicht benadrukt om betrouwbaarheid te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot bouwt, maar niet zomaar een robot—eentje die artsen helpt bij het diagnosticeren van ziekten, beslist wie een lening krijgt, of gebarentaal vertaalt voor doven. Voordat je op de "start"-knop drukt, moet je een regelboek schrijven. Dit regelboek wordt "requirements engineering" genoemd. Het is als de blauwdruk voor een huis; als de blauwdruk zegt "plaats hier een raam", dan plaatst de bouwer daar een raam. Maar wat als de blauwdruk vergeet te zeggen: "Zorg ervoor dat het raam niet zo groot is dat er een orkaan doorheen kan komen"? In de wereld van Kunstmatige Intelligentie (AI) worden die ontbrekende regels "ethische vereisten" genoemd. Dit zijn de instructies die de AI vertellen om eerlijk, transparant en vriendelijk te zijn, in plaats van bevooroordeeld of geheimzinnig.
Het probleem is dat het schrijven van deze ethische regels moeilijk is. Het vereist meestal een grote vergadering met veel verschillende mensen—ingenieurs, juristen, gemeenschapsleden—die urenlang discussiëren en brainstormen. Het is traag, duur en soms, omdat iedereen moe is, worden de belangrijkste ethische regels vergeten. Dit artikel stelt een grote vraag: Kunnen we een team van superintelligente computerbreinen, genaamd Large Language Models (LLM's), gebruiken om als een "morele waakhond" te fungeren en te helpen deze regels sneller te schrijven? Denk erbij als het inhuren van een team AI-detectives om naar de blauwdruk van je robot te kijken en te roepen: "Hé, je bent vergeten te controleren of dit wel eerlijk is!" voordat je überhaupt begint met bouwen.
Het Team van AI-detectives
De onderzoekers, Asma Yamani, Malak Baslyman en Moataz Ahmed, hebben een systeem gebouwd dat ze MALEA noemen (Multi-Agent LLM Ethics-Advocate). In plaats van één computer al het denkwerk te laten doen, creëerden ze een virtueel team van vier AI-agenten, elk met een specifieke taak, die samenwerken als een groep vrienden die een verhaal bewerken.
Eerst is er de Requirements Engineer, die een eenvoudige beschrijving van een systeem neemt (zoals "een app die nepbeoordelingen vindt") en probeert de initiële regels te schrijven. Vervolgens fungeert een Quality Assurance-agent als een strenge redacteur, die controleert of de regels duidelijk zijn en logisch zijn. Dan komt de ster van de show: de Ethics Advocate. Deze agent heeft als enige taak om naar de regels te kijken en te zeggen: "Wacht even, is dit wel eerlijk? Hoe zit het met de privacy? Wat als iemand gewond raakt?" Ten slotte schrijft een Documentation Assistant alles netjes op.
Deze agenten werken niet alleen in een rechte lijn; ze praten met elkaar in een lus. De Engineer schrijft een regel, de Quality-agent corrigeert de grammatica, de Ethics-agent bekritiseert de moraliteit, en de Engineer gaat terug om het te herstellen. Ze passen de bal steeds naar elkaar toe totdat iedereen het eens is dat de regels goed zijn. De onderzoekers testten dit team op twee scenario's uit de echte wereld: een systeem ontworpen om nep online beoordelingen in het Arabisch te detecteren, en een app die Saoedische Gebarentaal vertaalt naar tekst.
Wat het team vond
Toen de onderzoekers hun AI-team vergeleken met een menselijke expert en een enkele AI-computer, waren de resultaten een mix van "Wauw!" en "Oeps".
In het geval van de Fake Review Detector vond de menselijke expert 8 ethische regels tijdens een vergadering van 30 minuten. De enkele AI-computer vond er ongeveer 6 (75% recall), maar het MALEA-team vond er 7 (87,5% recall). Het AI-team was beter in het opmerken van de fouten van de mens. Zo miste de mens een regel over het bijhouden van "false positives" (wanneer een echte beoordeling onterecht als nep wordt gemarkeerd), maar voegde het AI-team een vereiste toe voor kwartaalrapportages om deze fouten bij te houden.
In het scenario van de Sign Language App vond de menselijke expert 13 regels. De enkele AI vond er ongeveer 8 (62%), terwijl het MALEA-team er ongeveer 7 vond (54%). Hier deed de menselijke expert het eigenlijk iets beter in het vangen van de specifieke technische details, zoals de noodzaak van een reactietijd van minder dan 5 seconden. Echter, het AI-team was een meester in het toevoegen van nieuwe ideeën die de mens niet had bedacht. Het AI-team suggereerde zaken als "geauditeerde anonimisering" (het verbergen van gebruikersidentiteiten op een manier die gecontroleerd kan worden) en specifieke encryptiestandaarden (zoals TLS 1.3) die de mens volledig over het hoofd had gezien.
Het artikel suggereert dat het AI-team uitstekend is in het werpen van een breed net van ethische ideeën en het zeer specifiek maken van vage regels. In plaats van alleen te zeggen "houd gegevens veilig", schreef het AI-team "gebruik AES-256 encryptie". De paper waarschuwt echter ook dat de AI niet perfect is. Soms missen ze specifieke culturele nuances of maken ze fouten met cijfers. In één run merkte de AI op dat vrouwen in Saoedi-Arabië verschillende soorten hoofdbedekkingen dragen en suggereerde dat de trainingsdata specifieke aantallen video's voor elk type moest bevatten. Maar in een andere run vergat de AI dit detail volledig. Dit laat zien dat de AI een beetje is als een creatieve schrijver die een detail soms wel onthoudt en soms vergeet.
Het oordeel: Een nuttige assistent, geen vervanging
De belangrijkste conclusie is dat dit multi-agent systeem een krachtig hulpmiddel is om snel een "eerste concept" van ethische regels te maken. Het kan meer ideeën genereren en specifieker zijn dan een enkele computer, en het vangt vaak zaken op die mensen kunnen missen tijdens een korte vergadering. Echter, de onderzoekers zijn heel duidelijk: dit vervangt de mens niet.
De AI is goed in het suggereren, maar heeft een mens nodig om te zeggen: "Ja, dat is een goed idee," of "Nee, dat past niet bij onze cultuur." Het systeem laat zelfs kleine "placeholders" achter (zoals [INSERT NUMBER HERE]) om ingenieurs eraan te herinneren dat ze de specifieke details moeten invullen. Het artikel betoogt dat we niet moeten proberen ethiek volledig te automatiseren; in plaats daarvan moeten we deze AI-teams gebruiken om het proces te versnellen, zodat mensen meer tijd kunnen besteden aan het bespreken van de moeilijke, belangrijke vragen in plaats van alleen maar de basisregels te schrijven.
Kortom, het artikel suggereert dat een team van AI-agenten kan fungeren als een fantastische "morele brainstormpartner", die ons helpt AI-systemen te bouwen die veiliger en eerlijker zijn, maar alleen als we een mens in de loop houden om de uiteindelijke beslissing te nemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.