← Nieuwste papers
🤖 machine learning

OnDeFog: Online Decision Transformer under Frame Dropping

Dit artikel stelt OnDeFog voor, een online reinforcement learning-methode die Decision Transformer-mechanismen integreert voor het afhandelen van frameverlies met directe interactie met de omgeving om bestaande offline en online benaderingen te overtreffen in omgevingen met hoge frameverliespercentages en data met lage beloningen.

Oorspronkelijke auteurs: Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert lopen, een auto te laten rijden of een videogame te laten spelen. Meestal geef je de robot een constante stroom aan informatie: "Hier ben je, dit heb je gedaan, en dit is hoe goed je het hebt gedaan."

Maar in de echte wereld gaat er wel eens wat mis. Soms hapert de camera, vertraagt het internet of faalt een sensor. Dit wordt frame dropping genoemd. Het is alsoast iemand die plotseling pagina's uit je instructiehandleiding rukt terwijl je aan het lezen bent. De robot weet niet meer waar hij is of wat er een seconde geleden gebeurde, en begint te wankelen.

Het probleem met eerdere oplossingen

Wetenschappers hebben geprobeerd dit eerder op te lossen, maar zij hadden twee hoofpproblemen:

  1. De "Bibliotheekstudent" (DeFog): Eén methode, genaamd DeFog, is als een student die alleen studeert uit een enorme, vooraf geschreven bibliotheek van eerdere spellen. Ze onthouden hoe ze met ontbrekende pagina's moeten omgaan als die ontbrekende pagina's in de bibliotheek voorkwamen. Maar als de robot een volkomen nieuwe situatie tegenkomt die niet in de bibliotheek stond, bevriest de "student" omdat ze dit nog nooit eerder hebben gezien. Bovendien is het verzamelen van die bibliotheek duur en moeilijk.
  2. De "Live Gamer" (ODT): Een andere methode, genaamd ODT, is als een gamer die leert door live te spelen. Ze kunnen omgaan met nieuwe situaties omdat ze in realtime aan het ontdekken zijn. Echter, als het internet hapert (frame dropping) terwijl ze aan het spelen zijn, raken ze in de war en presteren ze slecht omdat ze niet getraind zijn om met ontbrekende informatie om te gaan.

De nieuwe oplossing: OnDeFog

De auteurs van dit artikel hebben een nieuwe methode ontwikkeld genaamd OnDeFog. Zie OnDeFog als een hybride student die het beste van beide werelden combineert:

  • De Training: Eerst bestuderen ze de "bibliotheek" (offline data), net als DeFog. Maar hier komt de truc: tijdens het studeren doen ze alsof er pagina's ontbreken. Ze oefenen met het lezen van de handleiding met gaten erin, zodat ze leren hoe ze het ontbrekende kunnen raden op basis van wat eraan voorafging.
  • De Live Praktijk: Daarna gaan ze live een spel spelen (online learning), net als ODT. Omdat ze tijdens hun studie fase al geoefend hebben met "ontbrekende pagina's", raken ze niet in paniek wanneer het internet hapert tijdens het live spelen. Ze blijven soepel vooruitgaan.

Hoe het werkt (De metafoor)

Stel je voor dat je een auto rijdt met een GPS die soms het signaal verliest.

  • Oude ODT: Je vertrouwt volledig op de GPS. Als het signaal wegvalt, stop je of rijd je in cirkels omdat je niet weet waar je bent.
  • Oude DeFog: Je hebt een kaart van elke mogelijke route uit je hoofd geleerd. Als de GPS wegvalt, kijk je op je kaart. Maar als je een afkorting neemt die niet op de kaart staat, raak je verdwaald.
  • OnDeFog: Je hebt de kaart uit je hoofd geleerd én je hebt geoefend met het rijden terwijl de GPS willekeurig werd uitgezet. Dus wanneer het signaal wegvalt, weet je instinctief dat je moet vertrouwen op herkenningspunten en je geheugen van de afgelopen paar seconden om veilig door te blijven rijden, zelfs op nieuwe wegen.

Wat de experimenten lieten zien

De onderzoekers hebben deze nieuwe robotbestuurder getest in drie verschillende "gesimuleerde werelden" (opdrachten voor huppen, lopen en rennen) met verschillende niveaus van "signaalverlies" (frame dropping).

  1. Hoge signaalverlies: Wanneer het signaal verschrikkelijk was (veel gedropte frames), was OnDeFog de duidelijke winnaar. Het bleef goed presteren, terwijl de "Live Gamer" (ODT) volledig de fout in ging.
  2. Slechte datasets: Wanneer ze een "bibliotheek" gebruikten vol slechte, lage-beloningsvoorbeelden (zoals een oefenboek vol fouten), presteerde OnDeFog beter dan de "Bibliotheekstudent" (DeFog). Dit komt omdat OnDeFog live is gaan oefenen en zo betere manieren vond om te bewegen dan wat de slechte bibliotheek hen leerde.
  3. Het nadeel: OnDeFog is niet overal perfect. Als de bibliotheek al erg goed was (vol met voorbeelden met een hoge beloning), had OnDeFog soms moeite om zelfs betere paden te vinden dan wat er al in het boek stond. Het is alsof een student die zo druk is met het ontdekken van nieuwe routes, vergeet dat de oorspronkelijke kaart eigenlijk de beste route was.

De kern van het verhaal

OnDeFog is een slimmere manier om AI-agenten te trainen voor rommelige, echte omgevingen. Door de AI te leren om ontbrekende informatie te verwachten en te verwerken terwijl het leert van live ervaringen, wordt het veel robuuster dan eerdere methoden. Het gaat niet alleen over het onthouden van het verleden; het gaat over leren hoe je doorgaat wanneer de toekomst onzeker is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →