← Nieuwste papers
🤖 machine learning

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

Dit artikel introduceert PROSPER\texttt{PROSPER}, een bewezen efficiënt algoritme gebaseerd op het speltheoretische concept van de Maximum Entropy Blackwell Winner, om intransitieve voorkeuren in multi-objectieve voorkeursfine-tuning zonder scalarisatie aan te pakken, waarbij superieure prestaties worden aangetoond op grote taalmodellen met behulp van multi-objectieve beoordelaarsfeedback.

Oorspronkelijke auteurs: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

Gepubliceerd 2026-05-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren hoe hij een perfect verhaal moet schrijven. Je hebt een "Rechter" (een andere AI) die de verhalen van de robot leest en feedback geeft. Meestal vragen we de Rechter om één enkele score te geven, zoals "8 van de 10". Maar hier zit het probleem: de Rechter is vaak in de war. Hij kan zeggen dat Verhaal A beter is dan Verhaal B, en Verhaal B beter dan Verhaal C, maar dan vreemd genoeg zeggen dat Verhaal C beter is dan Verhaal A.

Dit heet intransitiviteit (of een cyclus). Het is als het spel Steen-Schaar-Doek: Steen wint van Schaar, Schaar wint van Doek, maar Doek wint van Steen. Er is geen enkele "beste" zet. Als dit gebeurt, raakt de robot in de war omdat hij niet weet welke richting hij moet leren.

Dit artikel introduceert een nieuwe manier om de robot te leren, zelfs wanneer de Rechter inconsistent is en de regels complex zijn.

Het Probleem: De Verwarde Rechter en de "Scalar" Valstrik

Meestal probeert een Rechter, wanneer hij een verhaal op veel verschillende aspecten moet beoordelen (bijvoorbeeld: Is het grappig? Is het veilig? Is het feitelijk?), al die scores samen te smelten tot één enkel getal. De auteurs noemen dit scalarisatie.

  • De Analogie: Stel je voor dat je een student beoordeelt. Je moet hem beoordelen op Wiskunde, Kunst en Hardlopen. Als je ze allemaal optelt tot één "Totale Score", kun je het feit missen dat de student een genie is in Wiskunde maar vreselijk slecht is in Kunst. Als de Rechter probeert deze te combineren tot één getal, ontstaan er vaak die verwarrende cycli (A > B > C > A), omdat hij probeert een vierkante peg in een rond gat te duwen.

De Oplossing: De "Maximum Entropy Blackwell Winner"

De auteurs stellen een nieuwe manier voor om de beste robotstrategie te vinden, die ze de Maximum Entropy Blackwell Winner noemen (laten we het de "Super-Aanpasbare Robot" noemen).

In plaats van te vragen: "Welk verhaal is absoluut het beste?" (wat misschien niet bestaat), vragen ze: "Welke robotstrategie is het moeilijkst te verslaan, ongeacht welke specifieke regel de Rechter vandaag besluit te focussen?"

  • De Analogie: Stel je een schaker voor die niet probeert de beste te zijn in één specifieke openingszet. In plaats daarvan speelt hij op een manier die ervoor zorgt dat hij nooit zwaar verliest, of de tegenstander nu aanvalt links, rechts of in het midden. Hij is robuust tegenover elke specifieke zwakte die de tegenstander zou kunnen uitbuiten. Deze "Super-Aanpasbare Robot" is degene die het vaakst wint tegen het worst-case scenario.

Het Algorithm: PROSPER

Om de robot daadwerkelijk te leren deze "Super-Aanpasbaarheid" te bezitten, hebben de auteurs een algoritme ontwikkeld genaamd PROSPER.

  • De Oude Manier: Meestal moet je, om een robot te leren omgaan met meerdere rechters, een gigantisch, chaotisch spel simuleren waarbij de robot speelt tegen een "schurk" die probeert hem te bedriegen. Dit is traag en computergewijs duur.
  • De PROSPER Manier: De auteurs vonden een wiskundige truc. Ze realiseerden zich dat ze in plaats van een complex spel met een schurk te spelen, gewoon een eenvoudige regressie (een type wiskundige aanpassing) kunnen gebruiken om de robot te leren.
  • De Analogie: Denk er zo over: in plaats van een sparringpartner in te huren om je in je gezicht te slaan om je te leren hoe je moet ontwijken (wat moeilijk en gevaarlijk is), bekijk je gewoon een video van de slagen en leer je het patroon wiskundig. PROSPER laat de robot direct leren van de feedback van de Rechter, zonder dat er een complex gevecht gesimuleerd hoeft te worden. Het verandert een multi-player spel in een single-player huiswerkopdracht.

Wat Ze Dedden en Vonden

Het team testte dit op Large Language Models (LLMs) met behulp van een dataset waarbij de Rechter antwoorden beoordeelde op basis van specifieke checklists (rubrics).

  1. De Realiteitscheck: Ze bevestigden dat wanneer je een AI-Rechter vraagt om verschillende criteria (zoals veiligheid, stijl en feiten) apart te bekijken, hij nog steeds in de war raakt en cycli creëert. Het splitsen van de criteria helpt een beetje, maar lost het probleem niet volledig op.
  2. Het Resultaat: Toen ze PROSPER gebruikten om de robot te trainen, werd de robot veel beter in het volgen van instructies en natuurlijk chatten dan robots die met oudere methoden waren getraind.
  3. Het Bewijs: Ze publiceerden de getrainde robots (met 3 miljard en 7 miljard parameters) en toonden aan dat ze alle andere methoden versloegen op standaardtests voor het volgen van instructies en algemeen gesprek.

Samenvatting

Kortom, wanneer AI-rechters inconsistent zijn en in de war over wat een "goed" antwoord maakt, falen standaard trainingsmethoden. Dit artikel zegt: "Probeer niet het enige perfecte antwoord te vinden. Zoek in plaats daarvan de strategie die robuust genoeg is om elke van de verwarrende voorkeuren van de Rechter aan te kunnen." Ze bouwden een tool genaamd PROSPER die dit efficiënt doet, door een complex speltheorie-probleem om te zetten in een eenvoudig wiskundig probleem, wat resulteert in slimmere, betrouwbaardere AI-modellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →