← Nieuwste papers
🤖 AI

Reasoning and Planning with Dynamically Changing Norms

Dit artikel introduceert een nieuwe aanpak voor het sturen van AI-agenten in mens-AI-interacties door gebruik te maken van een defecte berekening om conflicten op te lossen en dynamisch veranderende normen als veiligheidsmarges te benutten tijdens de planning, gevalideerd door zowel formele bewijzen als empirische testen met een dialoogagent genaamd SocialBot.

Oorspronkelijke auteurs: Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Taylor Olson, Roberto Salas-Damian, Kenneth D. Forbus

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer behulpzame robotassistent bent die in het huis van een mens woont. Je taak is om dingen voor hen te doen, zoals informatie delen of plannen maken. Maar hier zit de addertje onder het gras: mensen veranderen van mening, en hun regels voor jou veranderen mee.

Dit artikel gaat over het leren van een AI hoe het om moet gaan met die veranderende regels zonder in de war te raken of vertrouwen te breken.

Het Probleem: Het "Regelboek" Dat Blijft Veranderen

Denk aan de regels van een mens als een levend regelboek in plaats van een statische lijst.

  • Dag 1: Karli vertelt je: "Toon mijn medische gegevens nooit aan iemand."
  • Dag 2: Ze trouwt en zegt: "Oké, je mag mijn man mijn voorschriften laten zien."
  • Dag 3: Ze krijgt kinderen en zegt: "Nu moet je mijn kinderen vertellen over mijn gezondheidsproblemen."

Als je een standaard computerprogramma was, zou je vast kunnen lopen. Als je gewoon de eerste regel zou volgen, zou je op Dag 2 en 3 haar vertrouwen schaden. Als je gewoon de laatste regel zou volgen, zou je misschien de eerste hebben geschonden. Het artikel vraagt: Hoe houdt een AI gelijke tred met dit bewegend doelwit?

De Oplossing: "Beveiligingsrails" en een "Defeasible Calculator"

De auteurs bouwden een AI genaamd SocialBot om dit op te lossen. Ze gaven de bot niet zomaar een lijst met regels; ze gaven hem een speciale manier van denken genaamd een "defeasible calculus".

Hier is hoe het werkt met eenvoudige analogieën:

1. Het Concept van de "Beveiligingsrail"

Stel je voor dat de AI een auto bestuurt. Het "plan" is de route die het wil nemen. De "normen" (regels) zijn de beveiligingsrails aan de zijkant van de weg.

  • De AI hoeft niet door de regels gemotiveerd te worden om te rijden; het hoeft alleen maar de beveiligingsrails te controleren voordat het beweegt.
  • Als de beveiligingsrail zegt "Niet oversteken", stopt de auto.
  • Als de beveiligingsrail zegt "Je mag oversteken", gaat de auto.
  • Cruciaal: deze beveiligingsrails kunnen onmiddellijk worden verplaatst of verwijderd als de mens dat zegt.

2. De "Defeasible Calculator" (Het Brein)

Dit is het wiskundige deel dat ervoor zorgt dat de regels werken. "Defeasible" is een chique woord voor "kan worden teruggedraaid".

Denk er als een juridische rechtbank binnen het brein van de robot:

  • De Standaardveronderstelling: Het artikel stelt dat voor gevoelige zaken (zoals medische gegevens) de robot standaard "Nee" moet aannemen. Het is als een "Verbiedende Afsluiting". Als je niet expliciet "Ja" hebt gezegd, gaat de robot uit van "Nee" om veilig te zijn.
  • Het Bewijs: Wanneer een mens zegt: "Je mag het mijn man vertellen", is dat nieuw bewijs.
  • De Conflictoplossing: Wat gebeurt er als een mens zegt: "Vertel het niemand" (Regel A) en later zegt: "Vertel het mijn man" (Regel B)?
    • De "calculator" van de robot kijkt naar de data. Regel B is nieuwer.
    • Het controleert de reikwijdte. Bestrijkt Regel B hetzelfde gebied als Regel A? Ja.
    • Het Vonnis: Regel B "verslaat" (heft op) Regel A specifiek voor de man. De robot weet nu: "Vertel het niemand behalve de man."

Het artikel bewijst wiskundig dat dit systeem voorkomt dat de robot ooit denkt dat twee tegenstrijdige dingen tegelijk waar zijn (bijvoorbeeld: het denkt niet dat delen zowel "toegestaan" als "verboden" is).

Het Experiment: SocialBot in Actie

De onderzoekers testten dit met SocialBot, een chatbot die met mensen praat op Microsoft Teams.

  • De Opzet: Ze creëerden een nepwereld met 1.536 verschillende scenario's. In deze scenario's zouden gebruikers dingen zeggen als "Ik hou van pizza", dan "Vertel niemand mijn voedselvoorkeuren", en dan "Eigenlijk, je mag Bob vertellen over pizza".
  • De Test: Een derde persoon (zoals "Socrates") zou de bot vragen: "Wat houdt Plato van?"
  • Het Resultaat: De bot had 100% gelijk.
    • Als de regel was "Vertel het niet", zei de bot: "Ik kan het niet zeggen."
    • Als de regel was bijgewerkt naar "Vertel het Bob", vertelde de bot het aan Bob.
    • Als de regel was "Vertel het Bob, maar niet Socrates", vertelde de bot het aan Bob en bleef het stil tegenover Socrates.

Waarom Dit Belangrijk Is (Volgens Het Artikel)

De meeste AI's van vandaag (zoals grote chatbots) kunnen een gesprek voeren, maar ze kunnen worden bedrogen of gemanipuleerd om regels te breken. Ze hebben geen solide, wiskundige basis voor waarom een regel bestaat of hoe deze moet worden bijgewerkt wanneer een mens van mening verandert.

Dit artikel biedt een blauwdruk voor een AI die:

  1. Luistert naar menselijke regels.
  2. Begrijpt dat regels uitzonderingen kunnen zijn op andere regels.
  3. Die regels gebruikt als "beveiligingsrails" om zichzelf te stoppen met iets doen wat het niet zou moeten doen, zelfs als het dat wel wil doen.

Wat Het Niet Doet (De Grenzen)

De auteurs zijn zeer eerlijk over wat hun robot nog niet kan:

  • Het behandelt slechts de regels van één persoon tegelijk. Het kan de regels van Persoon A niet afwegen tegen die van Persoon B (bijvoorbeeld: "Mama zegt vertel het, papa zegt vertel het niet").
  • Het is getest op een synthetische dataset (nepgesprekken), niet op echte, complexe menselijke drama's uit de echte wereld.
  • Het gaat ervan uit dat de robot de basisfeiten al kent (zoals wie met wie getrouwd is) om de regels te begrijpen.

Kortom, dit artikel leert een AI hoe het een loyale maar flexibele assistent kan zijn die je veranderende privacywensen respecteert, en fungeert als een slimme beveiligingsrail die precies beweegt waar jij het naartoe zegt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →