CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs
Het artikel introduceert CEDAR-GRPO, een procesbewust reinforcement learning-framework dat algemeen abductief redeneren in grote taalmodellen verbetert door de correctheid van het uiteindelijke antwoord te combineren met abductieve beloningen, waarbij significante prestatiewinsten worden behaald over 11 onbekende taken in vergelijking met zowel de basismodellen als training die uitsluitend op correctheid is gericht.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het uitgestrekte landschap van kunstmatige intelligentie proberen onderzoekers voortdurend machines te leren hoe ze als mensen kunnen denken, en niet alleen hoe ze het volgende woord in een zin kunnen voorspellen. Een van de meest menselijke manieren van denken wordt abductief redeneren genoemd. Dit is het mentale proces van het bekijken van een reeks aanwijzingen of observaties en terugwerken om de meest waarschijnlijke verklaring voor deze te vinden. Dit is hoe een arts uitfigureert wat er mis is met een patiënt op basis van een paar symptomen, hoe een detective een misdaad reconstrueert uit verspreide bewijzen, of hoe een ingenieur een machine diagnosticeert die plotseling is gestopt met werken. Lange tijd hebben wetenschappers er moeite mee gehad om grote taalmodellen dit goed te laten doen. Hoewel deze modellen uitstekend zijn in het ophalen van feiten of het volgen van strikte logische regels, struikelen ze vaak wanneer ze gevraagd worden om verborgen oorzaken af te leiden uit onvolledige informatie. Ze hebben de neiging om het juiste antwoord te raden om de verkeerde redenen, of ze verzinnen feiten die plausibel klinken maar eigenlijk niet passen bij het verstrekte bewijs.
Een team onderzoekers van de Sharif University of Technology en de Universiteit van Teheran zette zich in om dit probleem op te lossen. Ze wilden weten of ze deze AI-modellen konden trainen om beter te worden in abductief redeneren op een manier die hen zou helpen nieuwe, ongeziene problemen op te lossen, in plaats van alleen de specifieke puzzels te memoriseren waarop ze getraind zijn. Ze ontwikkelden een nieuwe trainingsmethode genaamd CEDAR-GRPO. In plaats van het model simpelweg te belonen voor het krijgen van het juiste eindantwoord, ontwierpen ze een systeem dat het model ook beloont voor de manier waarop het daar kwam. Het systeem controleert twee specifieke zaken over het denkproces van het model: eerst, of het model daadwerkelijk elk detail in het verstrekte bewijs heeft bekeken en uitgelegd, en tweede, of het model zijn redenering in de juiste richting bewoog, beginnend bij de observaties en opbouwend naar een conclusie, in plaats van te beginnen met een conclusie en te proberen de bewijzen eromheen te dwingen.
Om dit te testen, namen de onderzoekers vier verschillende open-source taalmodellen en trainden deze op een zorgvuldig samengestelde set taken. Deze taken omvatten alles van het kiezen van de beste verklaring voor een kort verhaal tot het schrijven van code die een patroon in gegevens verklaart. Cruciaal was dat ze de modellen niet alleen de antwoorden lieten zien; ze gebruikten een techniek van reinforcement learning die fungeerde als een coach, die de modellen feedback gaf op hun redeneerstappen. De modellen leerden dat een correct antwoord niet genoeg was als ze een belangrijk detail hadden genegeerd of als hun logica achterstevoren was. Na deze training testten de onderzoekers de modellen op elf volledig andere taken die ze nog nooit eerder hadden gezien. Deze nieuwe taken varieerden van het diagnosticeren van medische aandoeningen en het debuggen van computercode tot het oplossen van complexe mysteries en het begrijpen van lange, ingewikkelde verhalen.
De resultaten toonden een duidelijke verbetering over de hele linie. De modellen die getraind waren met de nieuwe methode presteerden beter dan zowel hun originele versies als modellen die alleen getraind waren om het juiste eindantwoord te krijgen. Gemiddeld verbeterde de nieuwe methode de prestaties met 7,4 procentpunt ten opzichte van de originele modellen en met 2,7 punten ten opzichte van de modellen die alleen getraind waren op juistheid. In sommige specifieke gevallen was de verbetering zelfs zo hoog als 30,8 punten. Nog belangrijker is dat de onderzoekers de werkelijke tekst analyseerden die de modellen schreven terwijl ze nadachten. Ze ontdekten dat de getrainde modellen zich meer gedroegen als zorgvuldige onderzoekers. Ze waren eerder geneigd om verschillende mogelijkheden te verkennen voordat ze tot een antwoord kwamen, om expliciet verkeerde ideeën uit te sluiten, en om toe te geven wanneer ze onzeker waren. Ze vertoonden ook een veel sterkere gewoonte om hun conclusies direct te koppelen aan de specifieke feiten die ze kregen, in plaats van te vertrouwen op vage aannames.
De studie sloot ook verschillende alternatieve verklaringen voor dit succes uit. De onderzoekers bewezen dat de verbetering niet simpelweg voortkwam uit het feit dat de modellen meer voorbeelden zagen of uit een algemene boost in het redeneervermogen. Wanneer ze de modellen trainden op een vergelijkbare hoeveelheid algemene redeneerdata die niet gericht was op abductieve taken, vertoonden de modellen niet hetzelfde niveau van verbetering op de specifieke tests. Dit suggereert dat de specifieke manier waarop de modellen werden beloond voor hun redeneerproces de sleutelfactor was. De bevindingen wijzen erop dat abductief redeneren kan worden versterkt als een algemene vaardigheid die overdraagbaar is naar verschillende velden, in plaats van een smalle truc die alleen werkt op specifieke soorten puzzels. Door de modellen te leren de bewijzen te respecteren en een logisch pad van observatie naar verklaring te volgen, hebben de onderzoekers een belangrijke stap gezet naar het creëren van kunstmatige intelligentie die de wereld om zich heen echt kan begrijpen en verklaren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.