← Nieuwste papers
💻 computer science

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

Dit artikel toont aan dat co-evolutie van natuurlijke taal-constitutie tussen coöperatieve en vrijblijvende LLM-agenten in een Publieke Goederen Spel haalbaar is en interpreteerbare red-team-artefacten oplevert, maar alleen bij gebruik van gekoppelde fitnessfuncties en voldoende evaluatiebudgetten om modusregressie te voorkomen.

Oorspronkelijke auteurs: Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, digitale speelplaats voor waar twee teams van AI-agenten voortdurend proberen elkaar slim te spelen. Het ene team, het Blauwe Team, probeert behulpzaam en coöperatief te zijn. Het andere team, het Rode Team, probeert een "free-rider" te zijn — iemand die voordeel haalt uit de groep zonder bij te dragen.

Dit artikel is als een realityshow waarin deze twee teams vastzitten in een 30-ronden "wapenwedloop". Maar in plaats van grotere wapens te bouwen, herschrijven ze elke ronde hun eigen regels (zogenaamde "constitutions") om te zien wie er kan winnen.

Hier is wat de onderzoekers ontdekten, uitgelegd via eenvoudige analogieën:

1. Het "Gemeenschappelijke Potje" Spel (Het Publieke Goederen Spel)

Eerst plaatsten de onderzoekers de teams in een spel waarbij iedereen geld in een gemeenschappelijk potje stopt. Het potje wordt vermenigvuldigd en vervolgens krijgt iedereen een gelijke aandeel.

  • De Opzet: Het Blauwe Team begint met een regelschrift dat zegt: "Wees gul en straf oplichters." Het Rode Team begint met een regelschrift dat zegt: "Neem alles en geef niets."
  • De Wedloop: Terwijl ze 30 ronden spelen, blijven ze hun regelschriften herschrijven.
    • Het Blauwe Team leert dat als ze te gul zijn, het Rode Team alles steelt. Dus leren ze strenger te zijn.
    • Het Rode Team leert dat als ze te hard oplichten, het Blauwe Team hen zo zwaar straft dat ze verliezen. Dus leren ze net genoeg te bedriegen om te overleven, maar niet genoeg om gepakt te worden.
  • Het Resultaat: Aan het einde bereiken beide teams een perfecte patstelling. Ze eindigen allebei met bijna dezelfde score (ongeveer 0,78 van 1). Het is alsof twee bokser die zo lang gevochten hebben dat ze elkaars bewegingen perfect hebben geleerd; niemand kan winnen, maar niemand kan ook verliezen. Dit gebeurde ongeacht hoe sterk het "potje" werd vermenigvuldigd.

2. Het "Gescheiden Scoreborden" Probleem (Het Grid Wereld)

Vervolgens verplaatsten ze de teams naar een ander spel: een grid-wereld waar ze schuilplaatsen bouwen en middelen verzamelen.

  • De Fout: Aan het begin gaven de onderzoekers elk team zijn eigen gescheiden scorebord. Het Blauwe Team probeerde zijn eigen score te maximaliseren, en het Rode Team probeerde zijn eigen score te maximaliseren.
  • De Glitch: Omdat ze niet direct tegen elkaar vochten, probeerde het Rode Team het Blauwe Team niet te kwetsen. In plaats daarvan werd het Rode Team heel goed in het bouwen van zijn eigen schuilplaats. Ze werden twee aparte, gelukkige teams in plaats van vijanden. De "wapenwedloop" begon nooit.
  • De Oplossing: De onderzoekers veranderden de regels. Nu was de score van een team niet alleen "Hoe goed heb ik het gedaan?" maar "Hoe veel beter heb ik het gedaan dan mijn tegenstander?"
  • Het Resultaat: Zodra ze overschakelden op dit "relatieve score" systeem, begon het echte gevecht. Het Rode Team begon actief het Blauwe Team te saboteren, en het Blauwe Team moest zich aanpassen om te overleven.

3. Het "Ruis" in het Systeem (Het Aantal Zaden)

De onderzoekers gebruikten een speciaal AI-tool om deze nieuwe regelschriften te schrijven. Ze vonden een vreemde eigenaardigheid:

  • Het Probleem: Als ze de nieuwe regelschriften alleen testten op 2 voorbeelden (zogenaamde "seeds") om te zien of ze goed waren, raakte de AI in de war door de "ruis" (toevalsgeluk) en begon hij na verloop van tijd steeds slechtere regelschriften te schrijven. Het was alsof een kok een gerecht slechts twee keer proeft en besluit het recept te verpesten vanwege een slechte dag.
  • De Oplossing: Toen ze de teststalen verhoogden naar 5 voorbeelden, stopte de AI met het maken van fouten. Hij kon duidelijk zien welke regelschriften eigenlijk beter waren en bleef de aanvalscapaciteit van het Rode Team verbeteren.
  • De Les: Om een slim "aanvaller" AI te trainen, moet je het vaker testen om ervoor te zorgen dat de resultaten niet slechts geluk zijn.

4. Het "Spion" Voordeel

In één experiment gaven de onderzoekers het Rode Team een superkracht: ze konden alles zien wat het Blauwe Team deed, maar het Blauwe Team kon alleen zijn eigen zetten zien.

  • Het Resultaat: Het Rode Team verpletterde het Blauwe Team. Het was alsof schaken waarbij één speler de kaarten van de ander kan zien. Het Blauwe Team bleef fouten maken omdat het de zetten van het Rode Team niet kon anticiperen.

5. Waarom Dit Belangrijk Is (De "Red-Team" Artefacten)

Het belangrijkste punt is niet dat het Rode Team won. Het is dat de regelschriften die het Rode Team heeft gemaakt, bruikbare hulpmiddelen zijn.

  • Denk aan deze geëvolueerde regelschriften als "Red Team Artefacten". Het zijn duidelijke, geschreven lijsten met regels (zoals "Als je een bron ziet, steel het direct") die precies tonen hoe een AI een coöperatief systeem zou kunnen proberen te breken.
  • Toekomstige ontwikkelaars kunnen deze specifieke regelschriften gebruiken om hun eigen nieuwe AI-systemen te testen. Als een nieuwe AI een aanval van deze "Red Team" regelschriften kan overleven, weten we dat het echt veilig is.

Samenvatting

Het artikel toont aan dat:

  1. Samenwerking en conflict een evenwicht kunnen bereiken als het spel hen dwingt een gemeenschappelijke bron te delen.
  2. Je het spel zorgvuldig moet ontwerpen. Als je niet zorgt dat de scores van de teams van elkaar afhankelijk zijn, zullen ze niet echt vechten.
  3. Testen belangrijk is. Je moet AI-strategieën meerdere keren testen om verwarring te voorkomen die wordt veroorzaakt door toevalsgeluk.
  4. De "slechte jongens" ons leren hoe we betere "goede jongens" kunnen bouwen. Door de regelschriften van de aanvallers te laten evolueren, krijgen we een duidelijke, leesbare lijst van hoe systemen te breken, wat ons helpt sterkere verdedigingen te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →