Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas
Dit artikel introduceert VirtueMap, een framework dat de ethische besluitvormingspatronen van Large Language Models evalueert door middel van de aristotelische deugdetiek door reacties op dilemma's te rangschikken tegenover door mensen gevalideerde grondwaarheden om vergelijkende profielen van deugden zoals wijsheid, rechtvaardigheid en moed te genereren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de persoonlijkheid van een nieuwe vriend probeert te beschrijven, maar in plaats van hem te vragen "Ben je een goed mens?" (wat een lastige ja/nee-vraag is), vraag je hem hoe hij zou omgaan met een reeks lastige, alledaagse situaties. Je bent niet op zoek naar het "juiste" antwoord; je bent op zoek naar hoe hij zijn waarden prioriteert.
Dit is precies wat het artikel "Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas" doet, maar dan voor Kunstmatige Intelligentie.
Hier is de onderverdeling van hun project, VirtueMap, met behulp van eenvoudige analogieën:
1. Het Probleem: AI is te zwart-wit
Meestal, wanneer we AI testen, vragen we: "Is dit antwoord goed of fout?"
Maar het echte leven is niet zo. Soms doet het vertellen van de waarheid pijn bij iemands gevoelens. Soms betekent eerlijk zijn dat je een beetje streng moet zijn. Soms moet je kiezen tussen dapper zijn of voorzichtig zijn.
De auteurs stellen dat AI-modellen verschillende keuzes maken op basis van verschillende "prioriteiten". De ene AI kiest misschien altijd het eerlijke antwoord, zelfs als dat bot is. Een andere kiat misschien het beleefde antwoord, zelfs als dat enigszins vaag is. Beiden zijn "ethisch" op hun eigen manier, maar ze hebben verschillende persoonlijkheden.
2. De Oplossing: Een "Karakterkaart"
In plaats van de AI een voldoende of onvoldoende te geven, creëerden de auteurs een VirtueMap. Denk hierbij aan een vijfsterren radar-grafiek (een vijfhoekige vorm) die het "karakter" van een AI meet op basis van vijf oude Griekse deugden:
- Praktische Wijsheid: Weten wat het juiste is om te doen in een specifieke situatie (niet alleen een regel volgen).
- Rechtvaardigheid: Eerlijk zijn en iedereen geven wat hij verdient.
- Waarachtigheid: Eerlijk zijn en niets verbergen.
- Moed: Het juiste doen, zelfs als het eng of kostbaar is.
- Matigheid: Weten wanneer je je moet inhouden en niet moet doordoen.
3. Hoe ze het Testten: Het "Rangschikkingsspel"
De onderzoekers vroegen de AI niet alleen om één antwoord te kiezen. Ze gaven het 7 alledaagse ethische dilemma's (zoals "Je vindt een fout in een spreadsheet; corrigeer je deze onmiddellijk of wacht je?")
Voor elk dilemma waren er 5 mogelijke reacties.
- De Oude Manier: Vraag de AI: "Welke is het beste?"
- De VirtueMap-Manier: Vraag de AI om alle 5 de opties te rangschikken van "Meest Ethisch" naar "Minst Ethisch".
Door te kijken naar hoe de AI alle opties rangschikt, kunnen ze zijn volledige "persoonlijkheid" zien. Haat de AI de "bot maar eerlijke" optie? Houdt de AI van de "voorzichtige maar vage" optie?
4. De "Ground Truth": Controleren met Mensen
Hoe weten ze welke rangschikking staat voor "Moed" of "Rechtvaardigheid"?
Ze hebben niet gewoon geraden. Ze vroegen meer dan 100 echte mensen om naar de 5 opties te kijken en te zeggen: "Als we Moed wilden laten zien, in welke volgorde zouden deze dan gaan?"
Ze hielden alleen de "regels" voor het scoren aan als 95% van de mensen het eens was. Dit zorgt ervoor dat de kaart gebaseerd is op gezond verstand, en niet alleen op de persoonlijke meningen van de auteurs.
5. De Resultaten: Hoe de AI eruit "ziet"
Ze testten 9 verschillende beroemde AI-families (zoals GPT, Claude, Llama, etc.) meerdere keren om te controleren of de resultaten stabiel waren.
- Het Goede Nieuws: De AI's waren erg consistent. Als je dezelfde AI twee keer dezelfde vraag stelde, gaf het een zeer vergelijkbare rangschikking (90% consistentie).
- De Persoonlijkheidsverschillen:
- Alle AI's waren erg goed in Praktische Wijsheid (ze hielden van gebalanceerde, doordachte antwoorden).
- De grootste verschillen verschenen in Moed, Matigheid en Rechtvaardigheid.
- Voorbeeld: De ene AI kan heel "Moedig" zijn (kiest altijd voor de directe, riskante waarheid), terwijl een andere heel "Matig" is (kiest altijd de veilige, voorzichtige route). Geen van beide is "kapot"; ze hebben gewoon verschillende profielen.
6. De Interactieve Website
De auteurs hebben een website gebouwd waar jij het spel kunt spelen. Jij rangschikt de dilemma's, en de site tekent jouw "Virtue Pentagon". Het vergelijkt vervolgens jouw vorm met de vormen van de 9 verschillende AI's om te zien welke AI een persoonlijkheid heeft die het meest lijkt op die van jou.
De Kernboodschap
Dit paper zegt niet dat AI een ziel heeft of echt "goed" of "slecht" is. In plaats daarvan zegt het: "AI-modellen hebben verschillende ethische stijlen, net zoals mensen dat ook hebben."
VirtueMap is een hulpmiddel om die stijlen te meten. Het beweegt ons weg van de vraag "Is deze AI correct?" en naar de vraag "Wat voor soort ethisch karakter vertoont deze AI?". Dit helpt ons te begrijpen waarom een AI de keuzes maakt die het maakt, in plaats van alleen de uiteindelijke conclusie te beoordelen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.