Where does output diversity collapse in post-training?
Deze studie toont aan dat de ineenstorting van outputdiversiteit in nagestelde taalmodellen voornamelijk wordt veroorzaakt door de samenstelling van de trainingsdata tijdens het trainingsproces, en niet door het generatieformaat of inferentiemethoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Waarom worden slimme chatbots steeds saaier? Een onderzoek naar het "verlies van creativiteit"
Stel je voor dat je een groep jonge, nieuwsgierige studenten hebt (de basis AI-modellen). Ze zijn slim, maar soms wat chaotisch. Ze kunnen een verhaal schrijven, een wiskundig probleem oplossen of een code schrijven op duizenden verschillende manieren. Ze zijn divers, net als een echte klas.
Om ze "betrouwbaarder" en "hulpvaardiger" te maken, ondergaan ze een speciale training (de post-training). Dit is als een strenge schoolopleiding waar ze leren wat de "beste" antwoorden zijn. Maar er is een probleem: na deze training zijn ze niet alleen beter, ze zijn ook extreem saai. Ze geven allemaal precies hetzelfde antwoord, alsof ze een kopieerapparaat zijn geworden.
Deze studie van onderzoekers aan de Universiteit van Sheffield vraagt zich af: Waar gaat die diversiteit precies verloren? Is het de methode van lesgeven, of is het de inhoud van de lesboeken?
Hier is de uitleg, vertaald naar alledaagse taal met een paar creatieve vergelijkingen.
1. De drie verschillende scholen
De onderzoekers keken naar drie verschillende "scholen" die allemaal dezelfde basisstudenten (het Olmo 3-model) opleiden, maar met een andere aanpak:
- De "Think"-school (De Denkers): Deze studenten krijgen les van twee specifieke leraren die heel goed zijn in logisch redeneren (Chain-of-Thought). Ze moeten eerst hun gedachten opschrijven voordat ze antwoorden.
- De "Instruct"-school (De Instructeurs): Deze studenten krijgen les van veel verschillende bronnen (zoals GPT-3.5, GPT-4, enzovoort). Ze leren van een brede mix van voorbeelden en hoeven niet altijd eerst te "denken" in het openbaar.
- De "RL-Zero"-school (De Zelfleraren): Deze studenten krijgen geen lesboeken. Ze leren puur door zelf te proberen en direct feedback te krijgen op hun antwoorden (beloning of straf), zonder tussenkomst van leraren.
2. Het grote geheim: Het is niet de methode, maar de lesboeken
Het verrassende resultaat is dat waar de diversiteit verdwijnt, afhangt van wat ze hebben geleerd, niet van hoe ze werden getraind.
- Bij de "Think"-school: De diversiteit stort in tijdens de eerste lesfase (Supervised Fine-Tuning). Omdat ze alleen van twee leraren leren, worden ze al snel een spiegel van die twee. Het is alsof je een kind alleen maar laat luisteren naar twee zussen; het kind gaat precies zoals zij praten en denkt. Zodra ze die twee stemmen hebben overgenomen, is er weinig ruimte meer voor eigen creativiteit.
- Bij de "Instruct"-school: De eerste lesfase is minder erg, omdat ze van zoveel verschillende bronnen leren. Maar dan komt de tweede fase (DPO, een soort "keuzetraining" waar ze leren wat mensen niet leuk vinden). Hier wordt de diversiteit hard weggeveegd. Het is alsof de leraar zegt: "Alles wat niet perfect is, mag je niet meer doen." Hierdoor worden ze extreem uniform.
Conclusie: Als je wilt dat je AI divers blijft, moet je zorgen voor een brede mix van lesmateriaal (veel verschillende leraren), niet alleen een paar "perfecte" voorbeelden.
3. Het "Denkproces" is niet de boosdoener
De "Think"-school gebruikt een trucje: ze laten de AI eerst haar gedachten opschrijven (Chain-of-Thought) voordat ze het antwoord geeft. Sommigen dachten: "Misschien maakt dat lange denkproces de AI saai?"
De onderzoekers deden een experiment: ze lieten de "Denkers" niet meer denken, maar direct antwoorden geven.
- Het resultaat: De AI werd niet diverser. Ze bleef saai.
- De les: De saaiheid zit niet in de vorm van het antwoord (met of zonder gedachten), maar zit diep in het brein van de AI (in de gewichten). De AI heeft tijdens het leren geleerd dat er maar één "goed" antwoord is. Het is als een pianist die een liedje zo vaak heeft geoefend dat hij geen andere variaties meer kan bedenken, ongeacht of hij nu hard of zacht speelt.
4. Saaie antwoorden zijn soms goed, soms slecht
Niet alle verlies van diversiteit is even erg. De onderzoekers keken naar twee soorten "saaier worden":
- Het verwijderen van fouten (Goed): Bij wiskundige problemen is het fijn als de AI alleen het juiste antwoord geeft. Als de AI 16 keer een fout antwoord geeft en 1 keer een goed antwoord, is het "saai" worden (alleen het goede antwoord geven) eigenlijk een verbetering. Het is alsof een leraar alle fouten uit een werkboek verwijdert.
- Het uniform maken van goede antwoorden (Slecht): Bij creatieve taken (zoals een verhaal schrijven) of ethische vragen (wat vind je van een controversieel onderwerp?), is saaiheid slecht. Als de AI altijd precies hetzelfde verhaal vertelt of altijd hetzelfde standpunt inneemt, verliest ze haar menselijkheid. Hier is de "saaiheid" een verlies aan perspectief.
5. Wat betekent dit voor de toekomst?
De boodschap is duidelijk: Je kunt de saaiheid niet oplossen door de AI later "los te laten" (tijdens het gebruik).
- Als je een AI hebt getraind met te weinig variatie in de lesboeken, is ze al "gebroken" voordat ze begint.
- Om een diverse AI te krijgen, moet je tijdens het trainen zorgen voor een enorme, gevarieerde mix van data (veel verschillende leraren, veel verschillende stijlen).
- Het toevoegen van een "denkproces" (Chain-of-Thought) helpt bij de nauwkeurigheid, maar maakt de AI niet creatiever.
Kort samengevat:
Stel je voor dat je een bakker bent. Als je alleen maar bloem van één specifieke boer gebruikt (smalle data), krijg je altijd dezelfde smaak brood, hoe goed je ook kneedt (de trainingsmethode). Wil je een gevarieerde bakkerij? Dan moet je bloem van veel verschillende boeren kopen. De saaiheid zit in de ingrediënten, niet in de oven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.