ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions
Dieses Paper präsentiert die ERR@HRI 3.0 Challenge, welche zwei naturalistische, durch Crowdsourcing gewonnene Video-Datensätze einführte, um das End-to-End-multimodale maschinelle Lernen zur Erkennung von Bystander-Reaktionen auf Roboterfehler und zur Antizipation potenzieller Ausfälle voranzutreiben, wobei demonstriert wurde, dass die eingereichten Modelle die Baseline-Systeme übertrafen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie beobachten einen Roboter, der versucht, ein Sandwich zuzubereiten. Manchmal lässt der Roboter das Brot fallen. Manchmal versucht er, den Toaster in den Kühlschrank zu stellen. In der Vergangenheit versuchten Wissenschaftler, Roboter darauf zu trainieren, solche Fehler zu bemerken, indem sie ihnen eine Checkliste von „Merkmalen“ gaben (wie etwa „Liegt das Brot auf dem Boden?“) und sie baten, Daten zu analysieren, die bereits bereinigt und organisiert worden waren. Aber die Autoren dieser Arbeit sagen: „Moment mal! Das ist so, als würde man versuchen, Fahrradfahren zu lernen, indem man sich ein Diagramm eines Fahrrads in einem perfekt beleuchteten Studio ansieht. Das echte Leben ist chaotisch!“
Dieses Papier stellt ERR@HRI 3.0 vor, eine Challenge, die darauf abzielt, Robotern dabei zu helfen, ihre eigenen Missgeschicke besser zu erkennen – und sie sogar vorherzusagen, bevor sie passieren – indem sie auf echte, chaotische menschliche Reaktionen schauen.
Die zwei großen Missionen
Die Challenge gab Forschern zwei verschiedene „Videospiel-Level“ vor, die unter Verwendung von rohen, ungeschnittenen Webcam-Aufnahmen von Menschen gelöst werden mussten, die beobachteten, wie Roboter (und Menschen) scheiterten.
Level 1: Der „Ups!“-Detektor (Der BAD-Datensatz)
Stellen Sie sich 45 Personen vor, die vor einem Bildschirm sitzen und Videos beobachten, in denen ein Roboter oder ein Mensch einen Fehler macht. Das Ziel hier ist reaktiv: Kann ein Computer das Gesicht einer Person nachdem der Fehler passiert ist betrachten und sagen: „Oh, sie haben gerade ein Scheitern gesehen!“?
- Der Haken: Die Videos sind roh. Das Licht verändert sich, die Kamerawinkel sind schief und die Leute sitzen an unterschiedlichen Stellen. Es ist die reale Welt, nicht ein Labor.
- Die Daten: Es gab 46 verschiedene Fehlerszenarien und insgesamt 1.645 Videoclips. Die Clips sind etwa 15,5 Sekunden lang.
- Das Ergebnis: Die Challenge hatte 3 Teams, die Modelle eingereicht haben. Alle von ihnen waren besser als das eigene „Baseline“-Modell des Papers (welches im Grunde ein Standard-Neuronales-Netzwerk war, das sein Bestes gab). Das Baseline-Modell erreichte einen 0,502 Macro-F1-Wert (ein spezifischer Wert dafür, wie gut es die Erkennung von Fehlern und Nicht-Fehlern ausbalanciert, statt nur einer einfachen Genauigkeit), aber die neuen Modelle konnten diesen Wert übertreffen.
Level 2: Der „Warte, das ist eine schlechte Idee!“-Prädiktor (Der Bad-Idea-Datensatz)
Dies ist der coolere, hinterhältigere Teil. Stellen Sie sich 29 Personen vor, die ein Video davon sehen, wie ein Roboter beginnt, etwas zu tun, aber das Video schneidet ab, bevor wir sehen, ob er Erfolg hat oder scheitert. Die Menschen müssen raten: „Wird das gut ausgehen oder schlecht?“
- Das Ziel: Kann ein Computer das Gesicht einer Person betrachten, während sie rät, und sagen, was sie denkt, dass passieren wird? Dies ist antizipativ. Es geht darum, das „Oh-nein“-Gesicht zu erfassen, bevor der Crash passiert.
- Die Daten: Es gab 30 Szenarien und 865 Clips. Diese Clips sind super kurz, nur etwa 1,95 Sekunden lang.
- Das Ergebnis: Auch hier waren die 3 Teams, die dieses Level spielten, besser als die Baseline. Das Baseline-Modell hatte einen AUC-ROC-Score von 0,564 (ein Maß dafür, wie gut das Modell zwischen einer „guten“ und einer „schlechten“ Vermutung unterscheiden kann, wobei 0,5 reinem Raten entspricht), was zeigt, dass das Vorhersagen der Zukunft basierend auf einem Bruchteil einer Sekunde Gesichtsausdruck wirklich, wirklich schwer ist.
Wogegen dieses Paper „Nein“ sagt
Die Autoren sind sich sehr klar darüber, was bei diesem Problem nicht gut funktioniert, und sie haben die alten Wege explizit ausgeschlossen:
- Keine „vorbereinigten“ Daten: Das Paper stellt fest, dass die meisten bisherigen Arbeiten auf vorextrahierten Merkmalen basierten, was die Arten der Methoden einschränkte, die Forscher nutzen konnten. Um dies zu beheben, veröffentlichte die Challenge rohe Videodaten. Diese Designentscheidung diente nicht dazu, Feature-Engineering zu verbieten, sondern um Forschern zu ermöglichen, moderne End-to-End-Lernmethoden direkt auf Pixeldaten anzuwenden und zu sehen, ob sie das Chaos des echten Lebens besser bewältigen können als die alten Ansätze.
- Keine „Labor-perfekten“ Einstellungen: Sie lehnten die Idee ab, dass Roboter nur in kontrollierten Räumen mit perfekter Beleuchtung lernen sollten. Sie wollten die Unordnung von Crowdsourcing-Daten (unterschiedliche Kameras, seltsame Winkel), weil Roboter tatsächlich mit diesen konfrontiert werden werden.
- Nicht „nur reagieren“: Sie argumentierten, dass es zu spät ist, darauf zu warten, dass ein Fehler passiert, und ihn dann zu beheben. Sie drängten auf Antizipation – zu erkennen, dass etwas schiefläuft, bevor es vollends geschieht.
Wie sicher sind sie sich?
Das Paper behauptet nicht, dass sie das Problem der Robotersicherheit für immer gelöst haben. Stattdessen schlagen sie vor, dass ihre neuen Datensätze und Methoden ein besserer Ausgangspunkt sind.
- Sie haben die Ergebnisse mit spezifischen mathematischen Werten (wie Macro-F1 und AUC-ROC) auf einem Testdatensatz gemessen, den die Teams noch nie zuvor gesehen hatten.
- Sie fanden heraus, dass, obwohl die neuen Modelle besser als die alten Baselines waren, die „Antizipation“-Aufgabe (Level 2) immer noch schwierig ist. Die Baseline benötigte 35,6 % der Clipzeit, um überhaupt mit der Detektion des Signals zu beginnen, verglichen mit 8,8 % für die reaktive Aufgabe. Dies deutet darauf hin, dass das Lesen eines „schlechte Idee“-Gesichts viel schwieriger ist als das Lesen eines „Ups“-Gesichts.
- Die Autoren geben an, dass drei Teams gültige Modelle eingereicht haben und alle die Baselines übertroffen haben. Sie sagen nicht, dass die Modelle perfekt sind, sondern nur, dass sie ein Schritt nach vorn sind.
Das Fazit
Betrachten Sie dieses Paper als die Organisatoren einer Wissenschaftsmesse, die gesagt haben: „Hört auf, Roboter zu bauen, die nur in einem Glaskasten funktionieren. Lasst uns sehen, ob sie mit dem Chaos eines echten Wohnzimmers klarkommen können.“ Sie stellten zwei neue, chaotische, reale Videos zur Verfügung und forderten die klügsten Coder heraus, Modelle zu bauen, die einen Fehler eines Roboters erkennen oder eine Katastrophe vorhersagen können, bevor sie eintritt. Die Ergebnisse zeigen, dass es zwar möglich ist, besser als die alten Methoden zu sein, aber die „Kristallkugel“-Fähigkeit, Fehler vorherzusagen, noch immer eine Arbeit in Arbeit ist. Die Autoren hoffen, dass diese Werkzeuge helfen werden, Roboter zu bauen, die bewusster, vertrauenswürdiger und bereit für die chaotische Realität des menschlichen Lebens sind.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.