CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments
Dit artikel introduceert CoBRA, een nieuwe toolkit die gebruikmaakt van een closed-loop systeem dat een Cognitive Bias Index en een Behavioral Regulation Engine combineert om klassieke sociale wetenschappelijke experimenten systematisch te operationaliseren, waardoor onderzoekers in staat worden gesteld om cognitieve biases in op LLM gebaseerde sociale agenten consistent te specificeren en te controleren over verschillende modellen heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een regisseur bent die acteurs probeert te casten voor een toneelstuk over menselijk gedrag. In het verleden, als je een acteur een "koppige econoom" wilde laten spelen, zei je gewoon tegen hen: "Je bent een econoom die koppig is." Je hoopte dat ze de rol begrepen en er daarnaar handelden.
Het probleem, zoals dit artikel ontdekt, is dat verschillende acteurs (of in dit geval, verschillende AI-modellen) die eenvoudige instructie op totaal verschillende manieren interpreteren. De één speelt koppig, een ander speelt verward, en een derde doet precies het tegenovergestelde. Het is alsof je hetzelfde script aan drie verschillende mensen geeft en drie totaal verschillende voorstellingen krijgt. Dit maakt het onmogelijk om de resultaten van welke "toneelstuk" (simulatie) dan ook te vertrouwen, omdat je niet weet of de uitkomst het gevolg was van het verhaal of van de willekeurige interpretatie van de acteur.
Ontmoet CoBRA: De "Draaiknop" voor Menselijke Gebreken
De auteurs van dit artikel hebben een nieuwe toolkit ontwikkeld genaamd CoBRA (Cognitive Bias Regulator for Social Agents). In plaats van te vertrouwen op vage instructies zoals "wees koppig", geeft CoBRA onderzoekers een precieze draaiknop om aan te draaien.
Denk hierbij aan een mengpaneel in een opnamestudio. In plaats van de geluidstechnicus te vertellen: "Maak de bas een beetje 'grimmig'", draai je simpelweg aan een knop met het label "Bas" naar exact 2.6. CoBRA doet dit voor menselijke denkfouten (cognitieve biases).
Zo werkt het, onderverdeeld in eenvoudige stappen:
1. De "Kalibratiegym" (De Test)
Voordat je aan de draaiknop kunt draaien, moet je weten waar de naald staat. CoBRA gebruikt een reeks klassieke, beroemde psychologische experimenten (zoals het "Aziatische ziekteprobleem", waarbij mensen andere keuzes maken afhankelijk van hoe een probleem wordt geformuleerd) als een gym.
- De Test: De AI wordt onderworpen aan deze psychologische puzzels.
- De Score: CoBRA meet exact hoeveel de AI "buigt" voor de truc. Als de AI gemakkelijk in de val loopt, krijgt het een hoge score voor die bias. Als de AI de truc negeert, krijgt het een lage score. Deze score wordt de Cognitive Bias Index (CBI) genoemd.
2. De "Regulator" (De Oplossing)
Zodra CoBRA de huidige score van de AI weet, gebruikt het een "Behavioral Regulation Engine" om het brein van de AI aan te passen totdat het exact het getal bereikt dat de onderzoeker wil.
Stel dat je wilt dat een AI matig vatbaar is voor groepsdruk (het "Bandwagon Effect"). Je zet de draaiknop op 2.6.
- Als de AI momenteel te koppig is (score 1.0), past CoBRA de interne instellingen aan om het iets waarschijnlijker te maken dat de AI de massa volgt.
- Als de AI een schaap is (score 4.0), past CoBRA dit aan om het meer onafhankelijk te maken.
Het papier laat drie manieren zien waarop CoBRa dit "bijsturen" doet:
- Prompt Engineering: Het geven van een zeer specifieke, op wiskunde gebaseerde instructie (bijv. "Acteer met 60% van de 'volg-de-menigte'-bias").
- Representation Engineering: Het voorzichtig sturen van het interne "denkproces" van de AI (de verborgen hersentoestanden) in de juiste richting, zoals het bijsturen van een auto terwijl deze rijdt.
- Fine-Tuning: Het geven van een kleine, gerichte les om de AI permanent een specifiek gedrag te laten leren.
3. Het Resultaat: Voorspelbare Acteurs
Het papier testte dit door te proberen "Econoom"-agenten en "Gewone Persoon"-agenten te creëren.
- Zonder CoBRA: Wanneer zij de oude methode gebruikten (gewoon zeggen "Je bent een econoom"), gedroegen verschillende AI-modellen zich totaal verschillend. Sommige economen waren naïef; sommige waren slim. Het was een chaos.
- Met CoBRA: Wanneer zij de draaiknop gebruikten om een specif
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.