← Nieuwste papers
🤖 machine learning

Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks

Dit artikel stelt Adversarially Trained DPT (AT-DPT) voor, een nieuw framework dat gelijktijdig een Decision-Pretrained Transformer en een populatie aanvallers traint om robuust in-context reinforcement learning te bereiken tegen beloningsvergiftigingsaanvallen, waarbij superieure prestaties worden aangetoond ten opzichte van standaard baselines in zowel bandit- als complexe MDP-omgevingen.

Oorspronkelijke auteurs: Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Visie: Een Robot Leren Leren van een Spiekbriefje

Stel je voor dat je een robot leert hoe hij een videogame moet spelen. Normaal gesproken zou je hem specifieke regels programmeren of hem urenlang laten oefenen totdat hij het spel begrijpt.

Maar dit artikel gaat over een ander soort robot: een robot die gebruikmaakt van In-Context Reinforcement Learning (ICRL). Denk aan deze robot als een superintelligente student die niet opnieuw geprogrammeerd hoeft te worden. In plaats daarvan geef je hem gewoon een "spiekbriefje" (een geschiedenis van eerdere zetten en beloningen) en zeg je: "Hier is hoe het spel werkt; ga nu maar spelen." De robot leest het spiekbriefje, ontdekt het patroon en begint direct te spelen.

Het artikel richt zich op een specifiek type robot genaamd DPT (Decision-Pretrained Transformer). Deze is erg goed in het lezen van dergelijke spiekbriefjes. Maar er is een probleem: Wat als iemand met het spiekbriefje rompt?

Het Probleel: Het "Vergiftigde" Spiekbriefje

In de echte wereld kan een kwaadwillende actor (een aanvaller) proberen de robot te misleiden. Ze kunnen het brein van de robot niet veranderen, maar ze kunnen wel de beloningen veranderen die de robot in zijn geschiedenis ziet.

  • Het Scenario: Stel je voor dat de robot leert om het beste fruit te selecteren op een markt.
  • De Aanval: Een saboteur verandert stiekem de prijskaartjes van het fruit in de geschiedenis van de robot. Ze laten rotte appels duur lijken (hoge beloning) en verse appels goedkoop (lage beloning).
  • Het Resultaat: De robot leest de vergiftigde geschiedenis, denkt dat de rotte appels de beste keuze zijn en begint ze ook daadwerkelijk te kopen. Dit wordt een Reward Poisoning Attack genoemd.

De meeste eerdere onderzoeken richtten zich op het beschermen van robots die tijdens de training leren. Dit artikel stelt de vraag: Hoe beschermen we een robot die "on the fly" leert door simpelweg een geschiedenis van gebeurtenissen te lezen?

De Oplossing: De "Sparringpartner"-methode (AT-DPT)

De auteurs creëerden een nieuwe methode genaamd AT-DPT (Adversarially Trained DPT). Ze hebben niet alleen geprobeerd de robot te repareren; ze hebben de robot geleerd hoe hij moet terugvechten met een techniek genaamd Adversarial Training.

Denk hierbij aan een vechtsportdojo:

  1. De Student (De Robot): We willen dat de robot leert om de beste acties te kiezen, zelfs wanneer de data rommelig is.
  2. De Sparringpartner (De Aanvaller): De onderzoekers creëerden een "schurk"-AI wiens enige taak het is om de robot te misleiden. Deze schurk probeert constant de geschiedenis (de beloningen) te herschrijven om de robot slechte keuzes te laten maken.
  3. De Trainingslus:
    • De Schurk probeert de geschiedenis van de robot te vergiftigen.
    • De Robot probeert de vergiftiging te negeren en de waarheid te achterhalen.
    • Ze doen dit keer op keer.
    • Uiteindelijk wordt de Robot zo goed in het herkennen van leugens dat hij nog steeds kan winnen, zelfs wanneer de Schurk zijn uiterste best doet om hem te misleiden.

Het resultaat is een robot die "alles al heeft gezien". Hij heeft geleerd dat de beloningscijfers soms leugens zijn, en hij weet hoe hij voorbij de leugens kan kijken om de echte waarheid te vinden.

Hoe Ze Het Testten

De onderzoekers testten deze "super-robot" in drie verschillende scenario's, als levels in een videogame:

  1. De Gokkasten (Bandits): Stel je een rij van vijf gokkasten voor. De robot moet uitzoeken welke het meest uitbetaalt. De aanvaller probeert te liegen over hoeveel elke machine uitbetaalt.
    • Resultaat: De AT-DPT-robot ontdekte de echte winnaars, terwijl standaardrobots (zoals Thompson Sampling of UCB) in de war raakten en de verliezers bleven kiezen.
  2. De Doolhof (MDPs): Stel je een robot voor die door een donkere kamer navigeert om een schat te vinden. De aanvaller probeert te liegen over hoe goed een bepaalde beweging was.
    • Resultaat: De AT-DPT-robot vond de schat veel betrouwbaarder dan andere methoden, zelfs toen de aanvaller slim en adaptief was (zijn leugens aanpaste op basis van wat de robot deed).
  3. De Visuele Doolhof: Ze testten het zelfs in een 3D-omgeving waar de robot moest navigeren met behulp van beelden. De AT-DPT-robot presteerde nog steeds beter dan de anderen.

Waarom Dit Belangrijk Is

Het artikel beweert dat door de robot te trainen om leugens (vergiftigde data) te verwachten, hij veel robuuster wordt.

  • Standaard robots zijn als mensen die alles geloven wat ze in een krant lezen. Als de krant een leugen drukt, geloven zij die.
  • De AT-DPT robot is als een detective die is getraind door een meestervervalser. Hij weet dat de krant kan liegen, dus hij controleert de feiten dubbel en vindt toch de waarheid.

De auteurs concluderen dat deze aanpak (het gebruiken van een populatie aanvallers om de leerling te trainen) een krachtige manier is om AI te bouwen die veilig en betrouwbaar is, zelfs wanneer de data waarop de AI vertrouwt, wordt gemanipuleerd door kwaadwillende actoren. Ze merkten ook op dat deze methode goed werkt, zelfs als de robot niet perfect is in het opsporen van de leugens, zolang hij maar is getraind tegen een verscheidenheid aan lastige aanvallers.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →