← Nieuwste papers
💻 computer science

Counterfactual Reasoning and Environment Design for Active Preference Learning

Dit artikel introduceert CRED, een nieuw framework voor actieve preferentielerning dat de beloningsschatting in robotica-taken met een lange horizon verbetert door het ontwerp van de omgeving en de selectie van trajecten gezamenlijk te optimaliseren via contrafactische redenering om diverse, informatieve queries te genereren voor menselijke voorkeursrangschikking.

Oorspronkelijke auteurs: Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone

Gepubliceerd 2026-07-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert navigeren door de wereld, maar je kunt hem niet simpelweg een regelboek overhandigen. Je kunt niet zeggen: "Neem altijd de snelste route" of "Steek nooit het gras over", want het echte leven is rommelig. Soms wil je snelheid, zelfs als dat een hobbelige rit betekent; andere keren wil je veiligheid, zelfs als dat langer duurt. Dit is de kern van Preference Learning (voorkeur-leren): een vakgebied waar robots leren wat mensen willen, niet door het verteld te krijgen, maar door te kijken naar hoe zij kiezen tussen verschillende opties. Denk aan een proever bij een restaurant. De robot weet niet of je van pittig of zoet houdt, totdat hij je twee gerechten laat zien en vraagt: "Welke ziet er beter uit?"

Er is echter een addertje onder het gras. Als de robot je willekeurig twee paden laat zien, verspilt hij misschien je tijd door te vragen naar routes die overduidelijk verschrikkelijk of identiek zijn. Dit wordt Active Preference Learning genoemd. Het doel is om een slimme interviewer te zijn: de juiste vragen stellen om jouw ware voorkeuren zo snel mogelijk te achterhalen. Maar bij complexe, lange reizen is het ongelooflijk moeilijk om te bepalen welke vragen gesteld moeten worden. De robot blijft vaak hangen in gokken, waardoor hij er niet in slaagt jouw unieke stijl van besluitvorming te leren, vooral wanneer hij nieuwe, vreemde omgevingen tegenkomt die hij nog nooit eerder heeft gezien.

Dit is waar het paper CRED introduceert, een slimme nieuwe methode die fungeert als een superkrachtige verbeeldingsmachine voor robots. De onderzoekers, Yi-Shiuan Tung, Bradley Hayes en Alessandro Roncone, stellen voor dat de robot, in plaats van alleen te vragen naar de huidige wereld, nieuwe werelden moet "verbeelden" en "Wat als?"-vragen moet stellen.

Zo werkt CRED, met behulp van een eenvoudige analogie: Stel je voor dat je probeert de favoriete ijsjes smaak van een vriend te raden. Een normale robot zou alleen kunnen vragen: "Vind je van vanille of chocolade?" keer op keer. CRED is echter anders. Eerst gebruikt het Counterfactual Reasoning (tegenfeitelijk redeneren). Het vraagt zichzelf: "Wat als mijn vriend van munt houdt, maar van chocolade haat? Wat zou hij dan kiezen?" Het simuleert deze "wat als"-scenario's in zijn hoofd, waardoor het een diverse set van denkbeeldige keuzes creëert die alle mogbare manieren dekken waarop zijn vriend zou kunnen denken. Dit helpt de robot om veel interessantere vragen te genereren, in plaats van saaie, repetitieve vragen.

Ten tweede gebruikt CRED Environment Design (omgevingsontwerp). Stel je voor dat je vriend alleen van chocolade houdt als het in een chique kom wordt geserveerd, maar van vanille in een gewone beker. Als je het hem alleen in gewone bekers serveert, zul je zijn ware voorkeur nooit leren. CRED realiseert zich dat de setting ertoe doet. Het "verbeeldt" zich het veranderen van de omgeving — misschien een grasveld veranderen in een grindweg of het weer aanpassen in een simulatie — om te zien hoe dat de keuze beïnvloedt. Door de wereld zelf aan te passen, kan de robot het perfecte scenario vinden om een vraag te stellen die het meeste onthult over jouw voorkeuren.

De onderzoekers hebben dit idee op twee manieren getest. Eerst gebruikten ze een digitale gridwereld met verschillende terreinen zoals zand, gras en grind. Daarna gebruikten ze echte kaartgegevens van OpenStreetMaps om afleverroutes te simuleren. Ze vergeleken CRED met andere topmethoden die ofwel willekeurige paden kiezen of zich aan de huidige omgeving houden.

De resultaten waren veelbelovend. In hun simulaties leerde CRED de "ware" voorkeuren veel sneller dan de andere methoden. Terwijl andere robots ongeveer 25 pogingen nodig hadden om het patroon te ontdekken, convergeerde CRED vaak in slechts 15 iteraties. Belangrijker nog: wanneer de robot in een compleet nieuwe omgeving werd gedropt die hij nog nooit had gezien, werkten de geleerde regels van CRED veel beter. Het had niet alleen de specifieke wegen uitgemomoreerd waarop het geoefend had; het had de logica van de voorkeuren geleerd, waardoor het kon generaliseren. Bijvoorbeeld, in de kaarttests verminderde CRED de fout in de beloningsvoorspelling met een enorme marge vergeleken met de beste vorige methode, waarbij het in sommige gevallen bijna perfecte nauwkeurigheid bereikte.

Het paper suggereert dat door "wat als"-denken te combineren met het vermogen om de wereld te herontwerpen, robots veel beter in staat zullen zijn om ons te begrijpen. Ze hoeven niet elke regel verteld te krijgen; ze kunnen onze waarden leren door de ruimte van mogelijkheden te verkennen, zowel in onze keuzes als in de werelden waarin we leven. Hoewel de huidige methode veel rekenkracht vereist om deze simulaties uit te voeren, geloven de auteurs dat deze aanpak de sleutel kan zijn tot robots die echt kunnen aanpassen aan menselijke behoeften in de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →