Amortizing intractable inference in large language models
Dit artikel stelt voor om GFlowNets te gebruiken om onhandelbare inferentie in grote taalmodellen te amortiseren, waardoor ze kunnen samplen uit complexe posterieure distributies voor taken zoals beperkte generatie en chain-of-thought redeneren als een data-efficiënt alternatief voor traditionele maximum-likelihood of beloningsmaximaliserende training.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Grote taalmodellen zijn enorme bibliotheken van menselijke kennis, gecomprimeerd in digitale netwerken die het volgende woord in een zin voorspellen op basis van wat eraan voorafging. Ze zijn getraind om uitstekend te zijn in het voortzetten van een verhaal of het beantwoorden van een vraag wanneer ze een startpunt krijgen, een proces dat natuurlijk van links naar rechts verloopt. Echter, veel van de meest interessante taken die we willen dat deze modellen uitvoeren, vereisen denken in de omgekeerde richting of het invullen van het midden van een verhaal. Stel je voor dat je het begin en het einde van een verhaal krijgt en wordt gevraagd het midden te verzinnen, of dat je wordt gevraagd de redenering achter een specifiek antwoord uit te leggen. In deze scenario's kan het model niet simpelweg het volgende woord raden; het moet zoeken door een enorm, complex landschap van mogelijkheden om het specifieke pad te vinden dat het begin met het einde verbindt. Dit is een moeilijk wiskundig probleem omdat het aantal mogelijke paden zo groot is dat het controleren ervan één voor één onmogelijk is, en de standaardmethoden voor het navigeren door dit landschap blijven vaak steken op slechts één of twee veelvoorkomende routes, waardoor de rijke variëteit aan geldige oplossingen die bestaan, wordt gemist.
Onderzoekers aan het Mila – Quebec AI Institute en de Universiteit van Oxford hebben een nieuwe manier ontwikkeld om deze modellen te leren hoe ze dat complexe landschap moeten navigeren. In plaats van het model te trainen om simpelweg een score te maximaliseren voor het "beste" antwoord, wat vaak leidt tot repetitief en nauw kijkend denken, gebruikten ze een methode genaamd amortized inference. Deze benadering behandelt het probleem als een zoektocht naar een diverse set correcte paden in plaats van één perfect pad. Hiervoor gebruikten ze een techniek die bekend staat als een generative flow network, die fungeert als een gids die leert te samplen uit het volledige bereik van mogelijke oplossingen, waardoor wordt gewaarborgd dat het model verschillende geldige redeneerketens verkent in plaats van te imploderen in één enkel, veelgebruikt patroon.
Het team demonstreerde dit door grote taalmodellen te finetunen om problemen op te lossen die meerstapsredenering vereisen, zoals rekenkundige berekeningen of het classificeren of een filmrecensie een mening of een feit uitdrukt. In één experiment vroegen ze het model om de ontbrekende middelste zin van een kort verhaal in te vullen, gegeven het begin en het einde. Standaardmethoden produceerden vaak zinnen die grammaticaal correct waren maar niet pasten bij de narratieve flow. De nieuwe methode slaagde er echter in om middelste zinnen te genereren die het begin en einde coherent verbonden, wat een veel groter vermogen toonde om de volledige context te begrijpen. In een andere test waarbij eenvoudige wiskundige problemen betrokken waren, werd het model uitgerust met een rekenmachine-tool en werd het gevraagd de berekening in stappen op te splitsen. Terwijl andere trainingsmethoden ervoor zorgden dat het model getallen herhaalde of de tool niet correct gebruikte, leerde de nieuwe aanpak het model om zijn stappen zorgvuldig te plannen, wat leidde tot een dramatische verbetering in nauwkeurigheid, vooral bij problemen die het nog nooit eerder had gezien.
De resultaten suggereren dat deze methode bijzonder krachtig is wanneer data schaars is. In een test met slechts tien voorbeelden van filmrecensies om van te leren, behaalde de nieuwe methode een aanzienlijk hogere nauwkeurigheid dan standaard trainingsmethoden, en bleef deze de andere methoden zelfs met vijftig voorbeelden overtreffen. De onderzoekers ontdekten dat door het model aan te moedigen een brede variëteit aan redeneerpaden te samplen en vervolgens hun conclusies te combineren, het systeem robuuster en betrouwbaarder werd. Dit is een cruciaal onderscheid, omdat het betekent dat het model niet alleen één manier om een probleem op te lossen memoriseert, maar de onderliggende structuur leert van hoe het erdoorheen moet denken. De studie geeft aan dat door de doelstelling te verschuiven van het vinden van het enkel meest waarschijnlijke antwoord naar het verkennen van de volledige diversiteit aan correcte antwoorden, we deze krachtige instrumenten flexibeler en beter geschikt kunnen maken voor complexe redeneertaken.
Het werk benadrukt ook een beperking in hoe huidige modellen vaak worden getraind. Wanneer modellen worden gedreven om een beloning te maximaliseren, zoeken ze vaak naar afkortingen, zoals het herhalen van dezelfde frase of het negeren van de werkelijke logica van een probleem, enkel om een hoge score te halen. De onderzoekers toonden aan dat hun methode deze valstrik vermijdt door de gehele distributie van mogelijke oplossingen te matchen, wat ervoor zorgt dat het model niet instort in één enkele, gebrekkige manier van denken. Deze benadering stelt het model in staat om beter te generaliseren naar nieuwe situaties, zoals het oplossen van rekenkundige problemen met meer cijfers dan waarvoor het getraind was, waar andere methoden faalden. De bevindingen bieden een veelbelovend pad vooruit om kunstmatige intelligentie meer in staat te maken tot werkelijke redenering, bewegend van eenvoudige patroonherkenning naar een meer genuanceerd begrip van hoe men argumenten construeert en problemen stap voor stap oplost.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.