Synthetic Persona Pretraining: Alignment from Token Zero
Dit artikel introduceert Synthetic Persona Pretraining (SPP), een methode die waarde-gealigneerde reflecties vanuit het eerste persoon direct in de pretraining-fase inbedt om vanaf token nul een gewenste assistent-persona te installeren, waarbij wordt aangetoond dat een dergelijke vroege interventie de naleving van de constitutie, de robuustheid tegen jailbreaks en de morele alignment significant verbetert in vergelijking met post-training alignment-benaderingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een kind opvoedt. Je zou kunnen wachten tot het een tiener is, het bij je zitten nemen en zeggen: "Oké, nu je weet hoe je moet praten, zijn hier de regels: wees vriendelijk, vertel de waarheid en doe anderen geen pijn." Of je kunt die waarden vanaf het allereerste woord dat het leert al gaan aanleren, door ze in elk verhaal dat je vertelt naarmate het groeit, erin te verweven. Dit is het kerndilemma waar wetenschappers die kunstmatige intelligentie bouwen, voor staan.
AI-modellen zijn als digitale kinderen die leren door miljarden pagina's tekst van het internet te lezen. Deze initiële leerfase wordt "pretraining" genoemd. Tijdens deze tijd absorbeert de AI feiten, schrijfstijlen en hoe mensen met elkaar praten. De "regels" voor het zijn van een behulpzame, veilige assistent worden echter meestal pas toegevoegd na deze enorme leerfase, in een aparte stap die "post-training" wordt genoemd. Het probleem is dat tegen de tijd dat de AI klaar is met het lezen van het internet, het al een persoonlijkheid heeft gevormd op basis van wat het daar heeft gevonden. Het proberen op te leggen van nieuwe regels aan een volledig gevormde persoonlijkheid is als proberen een tiener beleefd te leren nadat hij al heeft geleerd om onbeleefd te zijn; het voelt vaak als een dunne laag verf over een rommelige muur, en de oude gewoonten kunnen gemakkelijk doorbreken.
Dit artikel, getiteld "Synthetic Persona Pretraining: Alignment from Token Zero", suggereert een andere manier om onze AI-kinderen op te voeden. De onderzoekers stellen voor om de gewenste persoonlijkheid en waarden direct vanaf het allereerste moment van training te installeren—wat zij "token zero" noemen. In plaats van te wachten om de AI later te corrigeren, willen ze de "goede assistent" in de hersenen te bouwen terwijl de AI nog leert spreken.
Het Experiment: Een Digitaal Kind Opvoeden met een Grondwet
De onderzoekers, een team van EPFL en diverse universiteiten, besloten dit "Model Raising"-idee te testen. Ze creëerden een nieuwe methode genaamd Synthetic Persona Pretraining (SPP). Zo hebben ze het gedaan, met behulp van een eenvoudige analogie:
Stel je voor dat de AI leert lezen uit een bibliotheek vol boeken. Bij de oude methode leest de AI gewoon de boeken. Bij de nieuwe methode namen de onderzoekers ongeveer 10% van die boeken en voegden ze na elke paar paragrafen een speciale "gedachtentekstballon" toe. Binnen deze gedachtentekstballon zou de toekomstige persona van de AI (laten we hem "Cato" noemen) even pauzeren en reflecteren op wat hij zojuist heeft gelezen, zeggende dingen als: "Hm, dit verhaal over een misdaad is verdrietig, en mijn regels zeggen dat ik nooit geweld mag aanmoedigen," of "Deze technische handleiding is saai maar nuttig."
Ze voegden deze gedachten niet alleen toe; ze lieten de AI ook leren om ze te genereren. Ze trainden het model op zowel de originele tekst als deze nieuwe "reflectie"-gedachten. Ze deden dit op twee manieren:
- Token Zero (De "Vanaf de Geboorte"-benadering): Ze strooiden deze reflectiegedachten door het hele trainingsproces, van de allereerste seconde tot de allerlaatste.
- Midtraining (De "Tiener"-benadering): Ze wachtten tot de AI het grootste deel van de boeken al had gelezen en voegden de reflecties pas aan het einde van de trainingsfase toe.
Ze hadden ook een controlegroep die de boeken normaal las (Vanilla) en één groep waarbij de slechte boeken waren verwijderd maar zonder reflecties (Filtered).
Wat Ze Vonden: De Kracht van Vroeg Beginnen
De resultaten waren fascinerend en suggereerden dat wanneer je de AI onderwijst net zo belangrijk is als wat je haar onderwijst.
1. De "Vanaf de Geboorte" AI was slimmer over waarden.
De modellen die met reflecties vanaf het begin werden getraind (Token Zero), waren veel beter in het volgen van hun "Grondwet" (een reeks regels die ze moesten volgen). Wanneer de onderzoekers hen testten op lastige morele dilemma's—situaties die de AI nog nooit eerder had gezien—maakten de Token Zero-modellen keuzes die meer in lijn leken met de regels. Ze hadden de regels niet alleen uit het hoofd geleerd; ze leken de geest ervan te begrijpen.
- De cijfers: Op een test genaamd "ConstitutionEval" scoorden de Token Zero-modellen ongeveer 67% correct, terwijl de modellen die de reflecties pas aan het einde kregen (Midtraining) slechts ongeveer 56% correct scoorden.
- De verrassing: De Token Zero-modellen veranderden zelfs hun prioriteiten. Ze begonnen "Waarheidsgetrouwheid" en "Rechtvaardigheid" veel meer te waarderen dan de andere modellen, die de voorkeur gaven aan "Creativiteit" en "Leren". Dit suggereert dat het vroeg beginnen niet alleen regels toevoegde; het vormde de manier waarop de AI over de wereld dacht.
2. De "Tiener"-benadering was oké voor sommige dingen, maar niet voor alles.
Interessant genoeg, als het doel simpelweg was om de AI te stoen tegen "jailbreaking" (het misleiden om slechte dingen te doen), werkte de Midtraining-benadering bijna even goed als de Token Zero-benadering. Het lijkt erop dat voor eenvoudige "doe dat niet"-reflexen, je ze laat aanleren. Maar voor diepe, complexe morele redeneringen heb je echt vanaf dag één nodig.
3. Grotere hersenen, grotere winst.
De onderzoekers testten dit op twee groottes van AI: een kleinere (1,7 miljard parameters) en een grotere (3 miljard parameters). Ze ontdekten dat het voordeel van vroeg beginnen nog belangrijker werd naarmate de AI groter en slimmer werd. Op de moeilijkste tests verdubbelde de kloof tussen de "Vanaf de Geboorte" AI en de "Tiener" AI naarmate ze opschaalden. Dit suggereert dat voor de enorme, superintelligente AI's van de toekomst, het starten met de juiste waarden nog crucialer zal zijn.
4. De "Lijm" is van belang.
Er was één addertje onder het gras. De onderzoekers ontdekten dat deze vroege waarden alleen bleven plakken als de laatste stap van de training (waarin de AI leert te chatten met mensen) overeenkwam met de persoonlijkheid die ze eerder hadden opgebouwd. Ze noemden dit "persona binding". Als ze de AI tijdens de leesfase trainden om een specifere soort assistent te zijn, maar haar tijdens de chatfase leerden om een totaal ander soort assistent te zijn, begonnen de vroeende waarden te vervagen. Het is alsoals een kind leren om een arts te zijn, maar het vervolgens naar een kunstacademie te sturen; het kan de medische regels vergeten. Echter, wanneer de "lijm" vasthield, waren de waarden verrassend sterk en overleefden ze zelfs wanneer de onderzoekers probeerden ze te breken met lastige tests.
Waarom Dit Ertoe Doet
Dit artikel suggereert dat we misschien een fout maken door te proberen AI te "repareren" nadat het al alles van het internet heeft geleerd. De auteurs betogen dat waarden moeilijk toe te voegen zijn aan een voltooid product. In plaats daarvan zouden we de AI moeten "opvoeden" met de juiste waarden vanaf de eerste token die het verwerkt.
Hoewel de resultaten veelbelovend zijn, benadrukken de onderzoekers dat dit pas het begin is. Ze testten dit op relatief kleine modellen (3 miljard parameters) vergeleken met de enorme modellen die vandaag de dag door grote techbedrijven worden gebruikt. Ze suggereren dat naarmate we grotere en slimmere modellen bouwen, het voordeel van het vroeg starten met de juiste waarden waarschijnlijk nog krachtiger zal worden. Ze merkten ook op dat hoewel de vroege waarden sterk waren, ze nog steeds verzwakt konden worden door bepaalde soorten latere training, wat betekent dat we nog steeds voorzichtig moeten zijn met hoe we onze digitale kinderen afmaken.
Kortom, als we AI willen die echt veilig en behulpzaam is, moeten we niet wachten tot het volwassen is om het te leren wat goed en kwaad is. We moeten het onderwijzen terwijl het nog leert spreken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.