How Do Large Language Models Learn Concepts During Continual Pre-Training?
Dit artikel onderzoekt hoe grote taalmodellen concepten verwerven, behouden en vergeten tijdens continue pre-training door hun interne conceptcircuits te analyseren, waarbij het onderscheidende temporele leerpatronen, interferentie-effecten en transferdynamiek onthult die nieuwe circuitbewuste trainingsstrategieën motiveren om vergeten te beperken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Mensen begrijpen de wereld door dingen in mentale categorieën onder te verdelen. We zien een harig, viervoetig dier en herkennen het direct als een "hond", een concept dat een bundel gedeelde eigenschappen met zich meebrengt: het blaft, het heeft een staart en het kan rennen. Dit vermogen om specifieke observaties te abstraheren naar algemene ideeën is het fundament van het menselijk redeneren. Grote taalmodellen, de krachtige computerprogramma's die verhalen kunnen schrijven en vragen kunnen beantwoorden, proberen iets soortgelijks te doen. Ze worden getraind op enorme oceanen van tekst, waarbij van hen wordt verwacht dat ze deze soort abstracte concepten extraheren en opslaan binnen hun interne systemen. Maar hoewel we weten dat deze modellen kunnen leren, hebben we moeite gehad om precies te begrijpen hoe ze die kennis over de tijd vasthouden, of waarom ze het soms lijken te verliezen wanneer ze worden geconfronteerd met nieuwe informatie.
Jarenlang hebben onderzoekers geprobeerd in deze digitale geesten te gluren om te zien hoe ze werken. Sommigen hebben ze getest met vragen om te zien of ze feiten onthouden, terwijl anderen hebben geprobeerd de specifieke paden in kaart te brengen die de computer gebruikt om informatie te verwerken. Deze methoden kijken echter vaak naar geïsoleerde feiten of statische momenten in de tijd. Ze missen het dynamische proces van hoe een model een nieuw idee leert, het versterkt en het vervolgens mogelijk vergeet wanneer het gedwongen wordt om iets anders te leren. Dit gat in de kennis is cruciaal, want terwijl we deze modellen bijwerken met nieuwe gegevens, moeten we weten of ze werkelijk een stabiel begrip van de wereld opbouwen of slechts patronen memoriseren die zullen verdwijnen bij de volgende update.
Een team van onderzoekers probeerde dit mysterie op te lossen door te observeren hoe kunstmatige intelligentie in realtime specifieke concepten leert en vergeet. Ze creëerden een gecontroleerde omgeving met een dataset van verzonnen concepten. Stel je voor dat je een kind iets leert over een wezen genaamd een "Olre" dat het vermogen heeft om te rennen, of een "Foo" die vier poten heeft. Omdat deze wezens niet in de echte wereld bestaan, heeft de computer geen voorkennis van hen. Dit stelde de wetenschappers in staat om het leerproces vanaf het begin te observeren, vrij van enige bestaande vooroordelen. Ze trainden het model op deze fictieve feiten en introduceerden vervolgens een enorme hoeveelheid nieuwe, ongerelateerde tekst om te zien wat er zou gebeuren met de herinnering aan de "Olre" en de "Foo".
Wat zij ontdekten was een duidelijk, meetbaar patroon in hoe de interne structuur van het model veranderde. De onderzoekers ontdekten dat de computer een feit niet simpelweg op één plek opslaat; in plaats daarvan bouwt het een complex web van verbindingen, of een circuit, om dat idee te representeren. Door de vorm en dichtheid van deze weben te analyseren, konden ze voorspellen hoe goed het model een concept had geleerd en hoe waarschijnlijk het was dat het het zou vergeten. Ze vonden een verrassende afruil: de concepten die het model het snelst en sterkst leerde, waren vaak de concepten die het het gemakkelijkst vergat wanneer nieuwe informatie arriveerde. Het lijkt erop dat de kracht van het initiële leren de herinnering juist kwetsbaarder maakte wanneer het systeem werd gedwongen zichzelf te reorganiseren.
De studie onthulde ook hoe verschillende ideeën met elkaar interfereren. Wanneer het model probeerde om twee concepten die qua betekenis zeer vergelijkbaar zijn tegelijkertijd te leren, had het aanzienlijk meer moeite dan wanneer de concepten ongerelateerd waren. De interne weben voor deze vergelijkbare ideeën overlapten, wat een soort verkeersopstopping creëerde waarbij de computer niet gemakkelijk tussen hen kon onderscheiden. Daartegenover stelden de onderzoekers vast dat het leren van één type kennis het model juist kon helpen om een ander type te leren. Bijvoorbeeld: het model leren over de eigenschappen en functies van dingen, maakte het veel gemakkelijker voor het om later te leren over de relaties tussen gelijkaardige en tegenovergestelde woorden. Dit suggereert dat de volgorde waarin informatie wordt gepresenteerd diepgaand van belang is; sommige lessen fungeren als een fundament voor andere.
Misschien wel het belangrijkste is dat de onderzoekers lieten zien dat deze interne patronen niet slechts abstracte observaties zijn, maar ook gebruikt kunnen worden om de modellen zelf te verbeteren. Door naar de vorm van de leercircuits te kijken, konden ze identificeren welke concepten het grootste risico liepen om vergeten te worden. Ze gebruikten dit inzicht vervolgens om een eenvoudige trainingsstrategie te creëren: telkens wanneer het model nieuwe dingen leerde, zouden ze af en toe pauzeren en de specifieke concepten herhalen die het meest kwetsbaar waren. Deze gerichte herhaling, gestuurd door de interne structuur van het model, hielp de computer aanzienlijk om zijn kennis te behouden. Het werk suggereert dat we, door aandacht te besteden aan de interne architectuur van hoe deze modellen leren, ze effectiever kunnen onderwijzen, wat hen helpt een stabieler en betrouwbaarder begrip van de wereld op te bouwen, net als een student die weet welke aantekeningen hij moet doornemen voor een examen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.