Reinforcing Human Behavior Simulation via Verbal Feedback
Dit artikel introduceert DITTO, een model dat via versterkingsleer met verbale feedback is getraind om menselijk gedrag beter te simuleren, samen met de SOUL-benchmarksuite, waarbij aanzienlijke prestatieverbeteringen ten opzichte van basismodellen worden aangetoond en GPT-5.4 op meerdere mensachtige simulatietaken wordt overtroffen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: AI Leren "Menselijk Te Gedragen" door Ermee Te Spreken
Stel je voor dat je een kind leert zich te gedragen op een diner.
- De Oude Manier (Scalare Beloningen): Je geeft het kind na het eten een cijfer van "6 uit 10". Je vertelt ze niet waarom ze een 6 kregen. Praatten ze te veel? Gebruikten ze de verkeerde vork? Spatten ze soep? Ze hebben geen idee hoe ze het kunnen verbeteren, dus ze raden het volgende keer maar.
- De Nieuwe Manier (Verbaal Feedback): Je laat ze zitten en zegt: "Je hebt het geweldig gedaan met de servet, maar je viel je oma in de rede, en dat was onbeleefd. Volgende keer wacht je tot ze klaar is met spreken."
Dit artikel stelt dat huidige AI-modellen (LLM's) worden getraind zoals het kind dat een cijfer van "6" krijgt. Ze zijn goed in wiskunde en coderen omdat die dingen duidelijke juiste/foute antwoorden hebben (zoals een toetsscore). Maar wanneer we AI vragen om menselijk gedrag te simuleren – zoals optreden als een patiënt, een student of een vriend – werken simpele scores niet. Mensen leren sociale normen via woorden, uitleg en correcties, niet via cijfers.
De auteurs bouwden een nieuw systeem genaamd DITTO dat AI leert menselijk te handelen door deze "verbale feedback"-methode te gebruiken.
Hoe DITTO Werkt: Het "Concept en Polijsten"-Spel
Zie DITTO als een creatief schrijfwerkplaats waar de AI zowel de student als de redacteur is. Hier is het proces:
- Het Eerste Concept (De Student): De AI probeert een prompt te beantwoorden (bijv. "Speel een chagrijnige leraar"). Ze schrijft een reactie.
- De Kritiek (De Rechter): Een krachtige AI-"rechter" leest het concept en geeft verbale feedback. Ze zegt niet zomaar "Goed gedaan". Ze zegt: "Je was te beleefd. Een chagrijnige leraar zou ongeduldiger zijn. Ook heb je vergeten om het huiswerk te noemen."
- Het Tweede Concept (De Leraar): De AI neemt die specifieke feedback en schrijft een nieuwe, verbeterde versie van de reactie.
- De Les (De Magie): Het systeem traint de AI om naar de oorspronkelijke prompt te kijken en direct de verbeterde versie te genereren, zonder dat ze de feedbacktekst meer nodig heeft. Het is alsof de student de aantekeningen van de leraar leest, het essay verbetert, en dan het gevoel van hoe je een goed essay schrijft onthoudt, zodat ze de aantekeningen de volgende keer niet meer nodig heeft.
Het Resultaat: De AI leert het advies te "internaliseren". Wanneer je later met haar praat, gedraagt ze zich menselijker omdat ze heeft geleerd waarom bepaald gedrag beter is, niet alleen dat het beter is.
De Speelplaats: SOUL (Simulatiegym)
Om te testen of dit echt werkt, bouwden de onderzoekers een enorme gymzaal genaamd SOUL (Simulation gym Of hUman-Like behavior).
Stel je een gymzaal voor met 10 verschillende stations, die elk een ander type "menselijke" vaardigheid testen:
- Theory of Mind: Kan de AI begrijpen dat iemand anders iets weet wat zij niet weet? (Zoals een spelletje verstoppertje).
- Rollenspel: Kan ze optreden als een specifiek personage uit een boek zonder uit de rol te vallen?
- Sociale Vaardigheden: Kan ze een gesprek navigeren om een doel te bereiken (zoals een loonsverhoging vragen) zonder onbeleefd te zijn?
- Gebruikerssimulatie: Kan ze zich voordoen als een verwarde klant die met een helpdesk praat?
Ze ontdekten dat bestaande AI-modellen deze tests vaak faalden. Ze klonken te robotachtig, te perfect of te op elkaar gelijkend.
De Resultaten: DITTO Wint de Gymzaal
De onderzoekers testten hun nieuwe model (DITTO) tegen de beste bestaande modellen (inclusief reuzen van grote technologiebedrijven).
- De Score: DITTO verbeterde met 36% ten opzichte van het basismodel.
- De Showdown: DITTO versloeg het top-tier "GPT-5.4"-model op 6 van de 10 uitdagingen.
- Waar het Schitterde: Het was vooral goed in taken die nuance vereisen, zoals sociale vaardigheden en rollenspellen. Het leerde beter geheimen te bewaren en complexe gesprekken te hanteren zonder "vast te lopen" of nep te klinken.
Waarom Dit Belangrijk Is (Volgens Het Artikel)
Het artikel stelt dat we, om AI echt nuttig te maken voor het simuleren van mensen (zoals in therapie-bots, educatieve tutors of klantenservice-training), moeten stoppen met ze te behandelen als wiskundestudenten die alleen een cijfer nodig hebben. We moeten ze behandelen als sociale wezens die uitleg nodig hebben.
Door verbale feedback (woorden) te gebruiken in plaats van alleen scalare beloningen (cijfers), leert de AI de textuur van menselijk gedrag. Het leert dat "onbeleefd" zijn niet gewoon een laag cijfer is; het is een specifieke manier van spreken die gevoelens kwetst.
Kortom: DITTO is een AI die leerde menselijk te handelen door te luisteren naar gedetailleerde kritiek van een leraar, de correcties te oefenen, en vervolgens de aantekeningen van de leraar te vergeten omdat ze het eindelijk "begrepen" had.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.