← Nieuwste papers
📊 statistics

Provable Pluralistic Alignment: Multi-Party RLHF under Offline Human Feedback

Dit artikel stelt een verenigd offline RLHF-raamwerk voor pluralistische afstemming voor dat partijspecifieke beloningen gezamenlijk schat onder een laag-rangig lineair model en beleid optimaliseert voor Nash-, utilitaire en egalitaire doelstellingen, terwijl het ook algemene cyclische voorkeuren aanpakt via een pessimistische von Neumann-winnaar, alles met gevestigde niet-asymptotische prestatiegaranties.

Oorspronkelijke auteurs: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

Gepubliceerd 2026-09-09
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie groeit het besef dat machines niet met één enkele menselijke stem spreken. Wanneer we een computer vragen een verhaal te schrijven, een nieuwsartikel samen te vatten of advies te geven, willen verschillende mensen vaak verschillende dingen. De één hecht misschien waarde aan beknoptheid en directheid, terwijl een ander de voorkeur geeft aan nuance en emotionele diepgang. Een derde kan prioriteit geven aan veiligheid boven alles, terwijl een vierde op zoek is naar creativiteit. Jarenlang was de standaardmanier om deze machines te onderwijzen om al deze verschillende meningen te verzamelen, ze samen te voegen tot één grote hoop, en het systeem te trainen om het gemiddelde te bevredigen. Deze benadering gaat ervan uit dat menselijke onenigheid slechts ruis is, een tijdelijke verwarring die zal verdwijnen als we maar genoeg gegevens verzamelen. Maar in werkelijkheid zijn deze verschillen vaak diepgaand, hardnekkig en fundamenteel. Ze vertegenwoordigen echte conflicten in waarden, niet slechts willekeurige fouten. De uitdaging voor wetenschappers is niet langer alleen om een machine te maken die de meerderheid tevreden stelt, maar om er een te bouwen die kan leren van een menigte van duidelijke, soms tegenstrijdige standpunten en nog steeds tot één eerlijke beslissing kan komen die de structuur van die onenigheid respecteert.

Dit is het centrale probleem waar een team van onderzoekers van instellingen waaronder MIT, de University of North Carolina en Carnegie Mellon University zich mee bezighoudt. Zij zetten zich in om een specifiek puzzelstukje in het vakgebied van machine learning op te lossen, bekend als "pluralistische afstemming" (pluralistic alignment). Stel je een kamer voor vol mensen die proberen te beslissen over een enkele koers, maar die het niet eens kunnen worden over wat het beste resultaat is. In het verleden zouden computerwetenschappers simpelweg iedereen laten stemmen op elke mogelijke keuze, de stemmen tellen en de winnaar kiezen. De nieuwe benadering die in dit werk wordt beschreven, stelt dat deze methode te veel informatie wegwerpt. Als je de stemmen van een groep die van pittig eten houdt mengt met een groep die het haat, kun je eindigen met een flauwe, onbevredigende compromis die niemand tevreden stelt. In plaats daarvan stellen de onderzoekers een methode voor die de groepen gescheiden houdt tijdens het leren, precies begrijpt wat elke groep wil, en vervolgens een specifieke, transparante regel toepast om die verlangens samen te voegen tot één uiteindelijke beslissing.

De onderzoekers concentreerden zich op een setting waarin de computer leert van "offline" data. Dit betekent dat de machine niet in realtime met mensen praat; hij kijkt naar een enorme, reeds bestaande collectie records. In deze records hebben mensen twee verschillende opties vergeleken en aangegeven welke zij de voorkeur gaven. Cruciaal is dat de onderzoekers ervoor hebben gezorgd dat de gegevens bijhielden wie elke vergelijking maakte. Ze legden niet alleen vast dat "Optie A beter was dan Optie B"; ze legden vast dat "Groep A de voorkeur gaf aan Optie A, terwijl Groep B de voorkeur gaf aan Optie B." Door deze identiteiten te bewaren, kon de computer de specifieke voorkeuren van elke afzonderlijke groep leren, in plaats van ze te vervagen tot één verward gemiddelde.

Om deze complexiteit aan te pakken, ontwikkelde het team een wiskundig kader dat in twee hoofdfasen werkt. Eerst leert het systeem de verborgen regels die de voorkeuren van elke groep aansturen. Ze ontdekten dat hoewel verschillende groepen andere dingen willen, hun voorkeuren vaak een gemeenschappelijke onderliggende structuur delen, vergelijkbaar met hoe verschillende talen een gemeenschappelijke grammatica delen. Door deze gedeelde structuur te herkennen, kan de computer de specifieke verlangens van veel verschillende groepen leren met veel minder gegevens dan wanneer hij elke groep afzonderlijk zou proberen te leren. Deze stap is essentieel omdat het het systeem in staat stelt accuraat te zijn, zelfs wanneer de gegevens voor een specifieke groep schaars of incompleet zijn.

Zodra het systeem begrijpt wat elke groep wil, gaat het over naar de tweede fase: het nemen van de uiteindelijke beslissing. Hier testten de onderzoekers drie verschillende manieren om deze voorkeuren te combineren, die verschillende ideeën van rechtvaardigheid vertegenwoordigen. Eén methode, genaamd "Utilitair", telt simpelweg het totale geluk van alle groepen op en kiest de optie die de meeste algemene goedheid creëert. Een andere, genaamd "Egalitair", richt zich volledig op de groep die het minst tevreden is, om ervoor te zorgen dat de minstbedeelde groep zo gelukkig mogelijk wordt gemaakt. De derde methode, bekend als "Nash", streeft naar een evenwicht waarbij het product van ieders tevredenheid wordt gemaximaliseerd, wat effectief voorkomt dat een enkele groep volledig wordt genegeerd terwijl nog steeds algemene vooruitgang wordt beloond. De onderzoekers bewezen wiskundig dat hun methode een enkel beleid kan vinden dat goed presteert onder al deze definities van rechtvaardigheid, mits de gegevens voldoende zijn.

Een belangrijke bevinding van de studie is dat het simpelweg samenvoegen van alle gegevens en het negeren van wie wat zei, leidt tot een slecht resultaat. Wanneer de onderzoekers een scenario simuleerden met drie duidelijke groepen mensen, faalde de traditionele "gepoolde" methode om een eerlijk compromis te identificeren. Het koos vaak een optie die door één groep werd bemind maar door de anderen werd gehaat, waardoor de helft van de populatie volledig ontevreden bleef. In contrast hiermee identificeerde hun nieuwe methode, die de groepen tijdens de leerfase onderscheidde, succesvol een middenweg die een matig niveau van tevredenheid voor iedereen bood. Dit toonde aan dat de moeilijkheid bij het afstemmen van kunstmatige intelligentie niet alleen gaat over het hebben van genoeg gegevens, maar over het behouden van de structuur van menselijke onenigheid totdat er een duidelijke, intentionele keuze wordt gemaakt over hoe deze te beslechten.

De onderzoekers verkenden ook een moeilijker scenario waarbij menselijke voorkeuren niet gemakkelijk te reduceren zijn tot een eenvoudige score of rangschikking. Soms zijn de keuzes van mensen inconsistent; ze kunnen A verkiezen boven B, B boven C, maar dan weer C boven A. In die gevallen stort de standaardmethode van het toekennen van een enkele waarde aan elke optie in. Om dit aan te pakken, ontwikkelde het team een nieuwe strategie gebaseerd op het concept van een "von Neumann-winnaar". Dit is een probabilistische benadering waarbij het systeem niet probeert de beste optie te vinden, maar eerder een strategie die onwaarschijnlijk is om te verliezen in een directe vergelijking met een andere strategie. Ze bewezen dat hun methode zelfs in deze rommelige, inconsistente situaties een stabiele, eerlijke oplossing kan vinden die de voorkeuren van alle partijen respecteert, mits de gegevens met voldoende zorg zijn verzameld.

Door middel van computersimulaties lieten het team zien dat hun benadering consequent beter presteert dan bestaande methoden. Wanneer ze hun algoritme testten op synthetische gegevens met variërende aantallen mensen en verschillende niveaus van overeenstemming, produceerde de nieuwe methode beslissingen die dichter bij de ideale uitkomst lagen voor elke groep. De simulaties bevestigden dat door de identiteiten van de groepen intact te houden en een gedeelde leerstructuur te gebruiken, het systeem efficiënter kon leren en eerlijkere keuzes kon maken. De resultaten hielden stand, of het doel nu was om het gemiddelde geluk te maximaliseren, de meest kwetsbare groep te beschermen, of een gebalanceerd compromis te vinden.

Dit werk vormt een belangrijke stap voorwaarts in hoe we denken over het trainen van kunstmatige intelligentie om te werken met diverse menselijke samenlevingen. Het beweegt weg van het idee dat er één enkele "juiste" manier van gedrag is die de machine moet ontdekken. In plaats daarvan behandelt het de diversiteit van menselijke opinie als een kenmerk dat beheerd moet worden, en niet als een fout die moet worden gecorrigeerd. Door het proces van het combineren van verschillende standpunten expliciet en wiskundig rigoureus te maken, hebben de onderzoekers een blauwdruk geboden voor het bouwen van systemen die conflicten kunnen navigeren zonder de afzonderlijke stemmen die het conflict creëren uit te wissen. De studie beweert niet dat het elk probleem in de mens-AI-interactie heeft opgelost, maar biedt een bewezen, betrouwbare manier om te leren van een menigte van onenigheid en een collectieve beslissing te produceren die statistisch solide en ethisch transparant is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →