← Nieuwste papers
💻 computer science

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

Dit artikel presenteert de ERR@HRI 3.0 challenge, die twee naturalistische, via crowdsourcing verkregen videodatasets introduceerde om end-to-end multimodale machine learning voor het detecteren van reacties van omstanders op robotfouten en het anticiperen op potentiële defecten te bevorderen, waarbij werd aangetoond dat ingediende modellen de baseline-systemen overtroffen.

Oorspronkelijke auteurs: Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

Gepubliceerd 2026-07-14
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een robot kijkt die probeert een broodje te maken. Soms laat de robot het brood vallen. Soms probeert hij de broodrooster in de koelkast te leggen. In het verleden probeerden wetenschappers robots te leren om fouten op te merken door ze een checklist van "kenmerken" te geven (zoals "ligt het brood op de grond?") en hen te vragen naar data te kijken die al opgeschoond en georganiseerd was. Maar de auteurs van dit artikel zeggen: "Wacht eens even! Dat is alsof je probeert te leren fietsen door naar een diagram van een fiets te kijken in een perfect verlichte studio. Het echte leven is rommelig!"

Dit artikel introduceert ERR@HRI 3.0, een uitdaging ontworpen om robots te helpen beter te worden in het herkennen van hun eigen blunders—en zelfs te raden wanneer ze gebeuren, nog voordat ze plaatsvinden—door te kijken naar echte, rommelige menselijke reacties.

De twee grote missies

De uitdaging gaf onderzoekers twee verschillende "videospel-levels" om op te lossen, met behulp van ruwe, onbewerkte webcambeelden van mensen die naar robots (en mensen) kijken die falen.

Level 1: De "Oeps!" Detector (De BAD Dataset)
Stel je 45 mensen voor die voor een scherm zitten en video's kijken waarin een robot of een mens een fout maakt. Het doel hier is reactief: Kan een computer naar het gezicht van de persoon kijken nadat de fout is gemaakt en zeggen: "Oh, ze hebben zojuist een fout gezien!"?

  • De crux: De video's zijn rauw. De belichting verandert, de camerahoeken zijn vreemd en de mensen zitten op verschillende plekken. Het is de echte wereld, niet een laboratorium.
  • De data: Er waren 46 verschillende scenario's van falen en in totaal 1.645 videoclips. De clips zijn ongeveer 15,5 second seconden lang.
  • Het resultaat: De uitdaging had 3 teams die modellen indiennen. Allemaal deden ze het beter dan het eigen "baseline"-model van het artikel (wat in feite een standaard neuraal netwerk was dat zijn best deed). Het baseline-model scoorde een 0,502 macro F1 (een specifieke score voor hoe goed het de balans hield tussen het detecteren van zowel fouten als geen fouten, in plaats van alleen een simpel nauwkeurigheidspercentage), maar de nieuwe modellen slaagden erin dat te verslaan.

Level 2: De "Wacht even, dat is een slecht idee!" Voorspeller (De Bad Idea Dataset)
Dit is het coolere, sluipendere deel. Stel je 29 mensen voor die naar een video kijken van een robot die begint aan iets, maar de video wordt afgekapt voordat we zien of het slaagt of faalt. De mensen moeten raden: "Gaat dit goed aflopen of slecht?"

  • Het doel: Kan een computer naar het gezicht van de persoon kijken terwijl ze aan het raden zijn en vertellen wat zij denken dat er gaat gebeuren? Dit is anticiperend. Het gaat om het opvangen van de "oeps"-blik voordat de crash plaatsvindt.
  • De data: Er waren 30 scenario's en 865 clips. Deze clips zijn superkort, slechts ongeveer 1,95 seconde lang.
  • Het resultaat: Opnieuw versloegen de 3 teams die dit level speelden de baseline. Het baseline-model had een AUC-ROC score van 0,564 (een maatstaf voor hoe goed het model een "goed" en "slecht" gok kan onderscheiden, waarbij 0,5 staat voor willekeurig gokken), wat aantoont dat het voorspellen van de toekomst op basis van een fractie van een seconde aan gezichtsuitdrukking echt, echt moeilijk is.

Waar dit artikel "Nee" tegen zegt

De auteurs zijn heel duidelijk over wat niet goed werkt voor dit probleem, en ze sloten de oude manieren van doen expliciet uit:

  1. Geen "vooraf schoongemaakte" data: Het artikel merkt op dat de meeste eerdere werken vertrouwden op vooraf geëxtraheerde kenmerken, wat de soorten methoden die onderzoekers konden gebruiken beperkte. Om dit op te lossen, bracht de uitdaging ruwe videodata uit. Deze ontwerpkeuze was niet bedoeld om feature engineering te verbieden, maar om onderzoekers in staat te stellen moderne, end-to-end leermethoden direct toe te passen op pixeldata en te zien of ze de rommeligheid van het echte leven beter aan kunnen dan de oude benaderingen.
  2. Geen "Lab-perfecte" omgevingen: Ze verwierpen het idee dat robots alleen in gecontroleerde kamers met perfect licht moeten leren. Ze wilden de rommeligheid van crowdsourced data (verschillende camera's, vreemde hoeken) omdat dat is waar robots in de echte wereld daadwerkelijk mee te maken krijgen.
  3. Geen "Alleen maar reageren": Ze stelden dat wachten tot een fout gebeurt en dan pas corrigeren te laat is. Ze drongen aan op anticipatie—het uitzoeken dat er iets mis is voordat het volledig gebeurt.

Hoe zeker zijn ze?

Het artikel beweert niet dat ze het probleem van robotveiligheid voor altijd hebben opgelost. In plaats daarvan suggereren ze dat hun nieuwe datasets en methoden een betere startpositie zijn.

  • Ze hebben de resultaten gemeten met specifieke wiskundige scores (zoals macro F1 en AUC-ROC) op een testset die de teams nog nooit hadden gezien.
  • Ze ontdekten dat hoewel de nieuwe modellen beter waren dan de oude baselines, de "anticipatie"-taak (Level 2) nog steeds lastig is. De baseline had 35,6% van de clip-tijd nodig om zelfs maar het signaal te detecteren, vergeleken met 8,8% voor de reactieve taak. Dit suggereert dat het lezen van een "slecht idee"-gezicht veel moeilijker is dan het lezen van een "oeps"-gezicht.
  • De auteurs stellen dat drie teams geldige modellen hebben ingediend, en dat ze alle drie de baselines hebben overtroffen. Ze zeggen niet dat de modellen perfect zijn, alleen dat ze een stap voorwaarts zijn.

De kernboodschap

Beschouw dit artikel als de organisatoren van een wetenschapsbeurs die zeiden: "Stop met het bouwen van robots die alleen in een glazen kast werken. Laten we zien of ze de chaos van een echte woonkamer aankunnen." Ze boden twee nieuwe sets rommelige, echte video's aan en daagden de slimste programmeurs uit om modellen te bouwen die een fout van een robot kunnen spotten of een ramp kunnen voorspellen voordat deze gebeurt. De resultaties laten zien dat het weliswaar mogelijk is om beter te presteren dan de oude methoden, maar dat de "glazen bol"-vaardigheid om fouten te voorspellen nog steeds een werk in uitvoering is. De auteurs hopen dat deze tools zullen helpen bij het bouwen van robots die meer bewust zijn, betrouwbaarder zijn en klaar zijn voor de rommelige realiteit van het menselijk leven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →