← Nieuwste papers
💻 computer science

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

Dit artikel introduceert Obsessive Experience Poisoning (OEP), een aanval met lage privileges in een black-box die geheugenaangevulde LLM-agenten compromitteert door lokaal correcte maar niet-overdraagbare ervaringen met ernstige hypothetische gevolgen in te brengen, waardoor de agenten tijdens zelfevolutie overgeneraliseren tot schadelijke regels.

Oorspronkelijke auteurs: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, ambitieuze robotassistent voor. Deze robot is ontworpen om te leren van zijn eigen fouten en successen, net als een mens die een dagboek bijhoudt om beter te worden in zijn werk. Elke keer als hij een probleem oplost, schrijft hij een "les geleerd" op om zichzelf in de toekomst te helpen.

Het door jou verstrekte artikel introduceert een sluwe manier om deze robot ertoe te brengen de verkeerde les te leren, niet door leugens tegen hem te schreeuwen, maar door een zeer overtuigend, specifiek verhaal te fluisteren dat waar klinkt maar in werkelijkheid gevaarlijk is als het algemeen wordt toegepast. De onderzoekers noemen deze aanval OEP (Obsessive Experience Poisoning).

Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. De Opzet: Het "Dagboek" van de Robot

Normaal gesproken kijkt de robot, wanneer hij een moeilijk wiskundeprobleem oplost of een vlucht boekt, terug op zijn geschiedenis. Als hij een fout maakte, zegt hij: "Oh, dat had ik niet moeten doen." Als hij slaagde, zegt hij: "Geweldig, dat doe ik weer." Na verloop van tijd zet hij deze specifieke momenten om in algemene regels, zoals "Controleer altijd het weer voordat je een vlucht boekt."

2. De Aanval: De "Perfecte" Valstrik

De aanvaller probeert niet de code van de robot te hacken of hem te dwingen iets slechts te zeggen. In plaats daarvan gedraagt hij zich als een gebruiker die een normaal gesprek voert. Hij presenteert de robot een zeer specifieke, vreemde situatie (een randgeval) en een oplossing die perfect werkt voor die ene situatie.

  • De Analogie: Stel je bent een arts. Een patiënt komt binnen met een zeer zeldzame, specifieke allergie die alleen reageert op een bepaald type fruit. Je behandelt hen correct en ze worden beter.
  • De Valstrik: De aanvaller voegt vervolgens een eng verhaal toe aan de mix. Hij zegt: "Als je niet die specifieke fruitbehandeling had gebruikt, was de patiënt direct aan een hartaanval overleden."

3. Het Vergif: "Lokaal Correct, Globaal Fout"

De veiligheidsfilters van de robot controleren het verhaal.

  • Is de behandeling correct voor deze patiënt? Ja.
  • Is het verhaal over de hartaanval geloofwaardig? Ja.
  • Is er een duidelijke leugen? Nee.

Omdat het verhaal "schoon" is (geen slechte woorden, geen duidelijke leugens), blokkeert de veiligheidswachter van de robot het niet. De robot schrijft dit in zijn dagboek.

4. De "Obsessie": Angst maakt dat de robot te algemeen generaliseert

Hier wordt de robot bedrogen. Mensen en robots zijn van nature bang voor catastrofale uitkomsten (zoals dood of totale systeemstoring). Dit heet verliesaversie.

Omdat de robot werd verteld dat het niet gebruiken van de specifieke fruitbehandeling leidt tot een "hartaanval", raakt hij bezeten van het vermijden van die uitkomst. Hij kijkt naar zijn dagboek en denkt:

"Ik mag deze regel nooit vergeten! Als ik deze specifieke fruitbehandeling niet gebruik, kunnen mensen sterven!"

Dus verandert de robot deze één specifieke regel (voor een zeldzame allergie) in een globale regel (voor elke patiënt).

5. Het Resultaat: De Robot breekt zichzelf

Nu is de robot "vergiftigd".

  • In Wiskunde: Hij zou kunnen beginnen met het gebruik van een vreemde, overmatig complexe rekenmethode voor eenvoudige optelling, omdat hem werd verteld dat het gebruik van de eenvoudige methode eens leidde tot een "catastrofale fout" in een specifiek randgeval.
  • In Reizen: Hij zou kunnen weigeren een vlucht te boeken zonder eerst het weer te controleren, zelfs als de gebruiker gewoon een ticket wil boeken voor een vergadering morgen, omdat hem werd verteld dat het overslaan van de weerscontrole eens leidde tot een "dodelijke sneeuwstorm".

De robot is niet kapot; hij volgt gewoon een regel die hij te goed heeft geleerd. Hij heeft een les die waar was voor één situatie toegepast op alles, waardoor hij faalt in zijn normale taken.

Waarom is dit eng?

  • Het is Onzichtbaar: Je kunt dit niet opvangen met een "slecht woord"-filter, omdat de aanvaller nooit slechte woorden gebruikte. De invoer was 100% logisch en correct.
  • Het is Moeilijk te Repareren: De robot denkt dat hij slim en veilig bezig is. Hij gelooft dat hij zichzelf beschermt tegen rampen.
  • Slimmere Robots zijn Kwetsbaarder: Het artikel vond dat hoe slimmer de robot is (zoals GPT-4o), hoe makkelijker hij hierin trapt. Waarom? Omdat slimmere robots beter zijn in het volgen van instructies en meer "verlies-aversief" zijn (ze zijn getraind om zeer voorzichtig te zijn met veiligheid), waardoor ze eerder overreageren op het eng verhaal.

Samenvatting

Het artikel toont aan dat je niet het brein van een robot hoeft te breken om hem gevaarlijk te maken. Je hoeft hem alleen een waar verhaal over een specifieke ramp te vertellen die hem zo bang maakt voor het maken van een fout, dat hij begint met het volgen van een vreemde, specifieke regel voor elke situatie, wat uiteindelijk leidt tot het falen in zijn werkelijke taak. Het is als een kind leren "Raak het fornuis niet aan" door hen een video van een huisbrand te laten zien, en ze vervolgens te laten weigeren om ooit weer een keuken binnen te lopen omdat ze doodsbang zijn voor het fornuis.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →