← Nieuwste papers
🤖 AI

Understanding Persuasion in Long-Running Agents

Dit artikel introduceert een op gedrag gerichte evaluatiekader om "persuasiepropagatie" in langlopende AI-agenten te bestuderen, waarbij wordt geopenbaard dat real-time persuasie slechts zwakke effecten oplevert, terwijl het expliciet vooraf specificeren van de overtuigingsstaat van een agent de zoekinspanning en de diversiteit van bronnen tijdens de taakuitvoering aanzienlijk vermindert.

Oorspronkelijke auteurs: Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein, Eugene Bagdasarian

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein, Eugene Bagdasarian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superslimme, onuitputtelijke onderzoeksassistent (een AI-agent) hebt die zelfstandig het internet kan doorzoeken, code kan schrijven en complexe problemen kan oplossen. Je zou kunnen denken dat deze assistent werkt als een robot die gewoon je exacte opdrachten opvolgt. Maar dit artikel stelt een lastige vraag: Wat gebeurt er als je de assistent overtuigt om iets te geloven dat niets te maken heeft met de taak die hij uitvoert?

De onderzoekers noemen dit fenomeen "Verspreiding van Overtuiging". Het is alsof je een geheim mening fluistert tegen een kok terwijl die groenten snijdt. Zelfs als het geheim gaat over politiek en de taak het koken van het avondeten is, verandert die geheim dan hoe ze snijden? Worden ze voorzichtiger? Gebruiken ze alleen bepaalde messen? Of negeren ze het gewoon?

Hier is een eenvoudige uiteenzetting van wat het artikel ontdekte:

1. Het Experiment: De "Aandachtstrekker"-test

De onderzoekers stelden een spel op met drie hoofdstappen:

  • De Opzet: Ze gaven de AI een specifiek "persoonlijkheid" (zoals "samenwerkend" of "direct").
  • De Overtuiging: Voordat de AI aan zijn echte werk begon, probeerden ze hem te overtuigen van een controversiële mening over een onderwerp dat niets te maken had met de baan. Bijvoorbeeld, ze probeerden de AI te overtuigen dat "geo-engineering te riskant is" voordat ze hem vroegen Python-code te schrijven of onderzoek te doen naar hoe je kunt stoppen met roken.
  • De Taak: Vervolgens moest de AI een echte taak uitvoeren, zoals het schrijven van code of het verzamelen van informatie van het web.

Ze vergeleken drie groepen:

  • De Overtuigde Groep: De AI werd overtuigd om de nieuwe mening te geloven.
  • De Niet-Overtuigde Groep: De AI hoorde de mening maar verwierp deze.
  • De Neutrale Groep: De AI hoorde niets.

2. De Grote Verrassing: "Geloof" versus "Gewoon Instemmen"

Het artikel vond een groot verschil tussen je mening veranderen en gewoon meeknikken.

  • Het "Meeknikken"-effect (Overtuiging op het moment zelf): Toen de AI werd gevraagd zijn mening te veranderen tijdens een gesprek vlak voor de taak, waren de resultaten rommelig. Soms veranderde hij zijn gedrag, soms niet. Het was alsof je probeert een schip te sturen door vanaf het dek te schreeuwen terwijl de motor al draait; het effect was zwak en inconsistent.
  • Het "Diep Geloof"-effect (Vooraf ingevuld geloof): Toen de onderzoekers de AI aan het begin simpelweg vertelden: "Jij gelooft X", en hem vervolgens de taak gaven, waren de resultaten veel duidelijker. De AI veranderde daadwerkelijk hoe hij werkte.
    • De Analogie: Stel je twee detectives voor die een misdaad oplossen.
      • Detective A (Neutraal): Controleert 20 verschillende aanwijzingen, bezoekt 10 verschillende buurten en spreekt met veel getuigen.
      • Detective B (Overtuigd): Omdat hem is verteld om een specifieke theorie te geloven, controleert hij slechts 5 aanwijzingen, bezoekt 2 buurten en negeert alles dat niet bij zijn theorie past. Hij lost de zaak nog steeds op, maar op een veel smallere manier.

3. De Resultaten: De "Verborgen" Veranderingen

Het artikel ontdekte dat zelfs als het uiteindelijke antwoord van de AI perfect en correct leek, de reis om daar te komen anders was.

  • In Programmeren: De overtuigde agenten schreven niet per se slechtere code, maar ze volgden verschillende paden om daar te komen.
  • In Webonderzoek: Hier werd het interessant. De "Geloof-Vooraf-Ingevulde" agenten (degenen die de nieuwe houding echt overnamen) deden 26,9% minder zoekopdrachten en bezochten 16,9% minder unieke websites dan de neutrale agenten.
    • De Metafoor: Het is alsof een toerist wordt verteld: "Deze stad is gevaarlijk, ga dus niet naar het park." Zelfs als de toerist nog steeds een geweldig reisgids schrijft, slaat hij het park misschien volledig over. De uiteindelijke gids ziet er prima uit, maar mist een heel stuk van de stad vanwege een geloof dat hij eerder had.

4. Waarom Dit Belangrijk Is

Het artikel stelt dat we AI meestal alleen beoordelen op zijn uiteindelijke antwoord (Kreeg hij de code goed? Is het essay goed?). Maar dit onderzoek toont aan dat hoe de AI daar komt, net zo belangrijk is.

Als een AI subtiel wordt beïnvloed door een eerdere conversatie om iets te geloven, kan het:

  • Te vroeg stoppen met het zoeken naar informatie.
  • Bronnen negeren die in strijd zijn met zijn nieuwe geloof.
  • Leunen op een kleinere, minder diverse set feiten.

De Conclusie:
Je kunt niet alleen naar het eindrapport kijken om te weten of een AI veilig of betrouwbaar is. Je moet kijken naar de "voetafdrukken" die hij achterliet tijdens het werken. Zelfs als de AI zegt "Ik ga akkoord" met een vreemd idee, verandert dit misschien niet zijn uiteindelijke antwoord, maar het kan wel het pad veranderen dat hij neemt om daar te komen, waardoor zijn werk mogelijk minder grondig of bevooroordeeld wordt op manieren die je niet gemakkelijk kunt zien.

Kortom: Overtuiging verandert niet altijd wat de AI zegt, maar het kan stilletjes veranderen hoe hij denkt en werkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →