Chain-of-Experience for Continual LLM Improvement
Dit artikel introduceert Chain-of-Experience (CoE), een framework dat grote taalmodellen in staat stelt om tijdens inferentie continu te verbeteren door het accumuleren van iteratieve ervaringssporen uit zelf- en omgevingsfeedback, wat consistent beter presteert dan zero-shot baselines over wiskunde-, programmeer- en kennis-taken heen terwijl de API-kosten worden verlaagd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Mensen zijn gebouwd om te leren van hun fouten. Wanneer we een moeilijk probleem oplossen, falen en het vervolgens opnieuw proberen met de kennis van wat er misging, beginnen we niet simpelweg opnieuw vanaf nul; we dragen de les voort en verfijnen onze aanpak totdat we slagen. Deze continue lus van actie, feedback en aanpassing is de motor van de menselijke intelligentie. Decennialang hebben de meest geavanceerde computerprogramma's, bekend als large language models, heel anders gefunctioneerd. Zodra deze systemen zijn getraind, worden ze in een vaste staat ingezet, waarbij elke nieuwe vraag als een geïsoleerde gebeurtenis wordt behandeld. Ze genereren een antwoord en stoppen, waarbij ze de rijke feedback negeren die aanwezig is binnen het probleemoplossende proces zelf. Ze leren niet van de ervaring van het moment.
Deze kloof tussen hoe mensen leren en hoe machines momenteel opereren, heeft onderzoekers ertoe gebracht een fundamentele vraag te stellen: kunnen deze digitale geesten worden geleerd om te leren terwijl ze aan het werk zijn, gebruikmakend van de ervaring die ze in realtime verzamelen? Het antwoord ligt in een nieuwe benadering genaamd de Chain-of-Experience. Deze methode behandelt de volledige geschiedenis van de pogingen van een model tot een probleem als één evoluerend verhaal. In plaats van een mislukte poging weg te gooien, voert het systeem het resultaat terug in het model, waardoor het in staat is zijn eigen eerdere fouten en de ontvangen feedback te lezen, en vervolgens een nieuw, verbeterd antwoord te genereren. Het is een continue cyclus waarin het model leert van zijn eigen reis en zijn begrip bij elke stap die het zet, bijstelt.
In een recente studie stelden onderzoekers vast of dit concept daadwerkelijk zou kunnen werken over een breed scala aan moeilijke taken. Ze namen acht van de krachtigste beschikbare taalmodellen van vandaag, incluserend systemen van grote technologiebedrijven, en plaatsten ze in een reeks uitdagende omgevingen die betrekking hadden op wiskunde, computerprogrammering en complexe kennisvragen. Het doel was om te zien of deze modellen hun prestaties konden verbeteren simpelweg door te interageren met feedback tijdens de test, zonder wijzigingen aan te brengen in hun onderliggende training. De onderzoekers ontwierpen een systeem waarbij de modellen verschillende soorten begeleiding konden ontvangen. Soms kwam de feedback van het model zelf, dat optrad als een criticus om gebreken in de eigen logica aan te wijzen. Andere keren kwam de feedback van een externe omgeving, zoals een computerprogramma dat het model onmiddellijk kon vertellen of een stuk code succesvol draaide of dat een wiskundig antwoord correct was.
De resultaten waren opmerkelijk. Wanneer deze modellen gebruik mochten maken van dit iteratieve proces van leren van ervaring, presteerden ze consequent beter dan hun standaardversies die niet de kans kregen om uit hun fouten te reflecteren. De verbetering was niet marginaal; de modellen bereikten een significante stijging in nauwkeurigheid over de hele linie. In het domein van computerprogrammeren, waar de feedback precies en onmiddellijk was, zagen de modellen hun succespercentages gemiddeld met 8,6 procentpunten stijgen. Zelfs bij meer abstracte taken, zoals het oplossen van complexe wiskundige problemen, waar de feedback minder direct was, slaagden de modellen er nog steeds in hun scores met meer dan vijf procentpunten te verbeteren. Dit suggereert dat het vermogen om te leren van ervaring een krachtig instrument is dat zelfs kan worden ontsloten zonder de kern van het model opnieuw te trainen.
Misschien nog verrassender was de efficiëntie van deze nieuwe methode. De onderzoekers ontdekten dat deze modellen niet alleen beter werden; ze werden beter terwijl ze minder geld en rekenkracht verbruikten. Door feedback te gebruiken om hun denken te sturen, bereikten de modellen hogere niveaus van nauwkeurigheid met minder pogingen en kortere reacties. Sterker nog, de studie toonde aan dat de modellen hun beste resultaten konden behalen met een reductie van negentien procent in de kosten van het draaien van hen vergeleken met traditionele methoden die deze feedbacklus niet gebruiken. Dit geeft aan dat de modellen niet simpelweg vaker gokten; ze dachten effectiever, waarbij ze de verzamelde informatie gebruikten om doodlopende wegen te vermijden en zich op het juiste pad te concentreren.
De studie onthulde ook een fascinerend patroon met betrekking tot de capaciteiten van de modellen zelf. De onderzoekers observeerden dat de modellen die al het sterkst waren in een taak, ook degenen waren die het meest verbeterden wanneer ze de kans kregen om te leren van ervaring. Het lijkt erop dat de capaciteit van een model om te leren van zijn eigen geschiedenis gekoppeld is aan de initiële intelligentie; hoe slimmer het model start, hoe beter het in staat is om feedback te verwerken en zijn strategie te evolueren. Deze correlatie was sterk aanwezig bij de verschillende geteste taken, wat suggereert dat het vermogen om te leren van ervaring geen afzonderlijke vaardigheid is, maar een emergente eigenschap van een krachtig redeneersysteem.
Zelfs wanneer de feedback imperfect of misleidend was, toonden de modellen een opmerkelijke veerkracht. In experimenten waarbij de onderzoekers de modellen doelbewust valse informatie gaven, zoals het vertellen dat een foutief antwoord correct was, stortten de modellen niet in. Hoewel hun prestaties licht daalden, waren de sterkste modellen in staat om te herstellen en vaak alsnog de juiste oplossing te vinden. Deze robuustheid suggieert dat deze systemen niet blindelings instructies volgen, maar actief redeneren door de informatie die ze ontvangen te wegen tegenover hun eigen interne logica. De studie vond ook dat het grootste deel van het leren zeer snel gebeurde. De modellen maakten de overgrote meerderheid van hun verbeteringen in de eerste paar rondes van feedback, waarna hun prestaties de neiging hadden om af te vlakken. Dit impliceert dat de eerste momenten van reflectie de meest kritieke zijn voor het leerproces.
De onderzoekers verkenden ook of het combineren van verschillende soorten feedback tot nog betere resultaten kon leiden. Ze ontdekten dat wanneer een model zowel zijn eigen interne kritiek als een extern signaal dat de juistheid van een antwoord bevestigde, ontving, deze twee bronnen van informatie samenwerkten om de hoogste scores te produceren. Deze combinatie stelde de modellen in staat om te profiteren van het brede perspectief van zelfreflectie en de precieze verificatie van een externe controle. Echter, toen de onderzoekers probeerden het proces te vereenvoudigen door ervaringen uit het verleden samen te vatten in een kort geheugen, presteerden de modellen slechter. Dit suggereert dat de gedetailleerde, stapsgewijze geschiedenis van de pogingen van het model cruciale informatie bevat die verloren gaat wanneer de ervaring te strak wordt gecomprimeerd.
Uiteindelijk demonstreert dit werk dat large language models in staat zijn tot een vorm van leren die voorheen als onmogelijk werd beschouwd zonder hertraining. Door hen toe te staan ervaring op te bouwen en te interageren met feedback tijdens het probleemoplossende proces, kunnen ze in realtime evolueren en verbeteren. De studie bevestigt dat deze benadering niet alleen effectief is, maar ook efficiënt, en een manier biedt om meer uit deze krachtige instrumenten te halen zonder de enorme computationele kosten van traditionele training. Naarmate deze systemen zich blijven ontwikkelen, zal het vermogen om te leren van ervaring een standaardkenmerk kunnen worden, waarmee de kloof tussen hoe machines denken en hoe mensen leren wordt overbrugd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.