← Neueste Arbeiten
💻 computer science

MUSE: Multimodal Uncertainty Quantification of State Estimation

Dieser Beitrag stellt MUSE vor, ein neuartiges, lernbasiertes Echtzeit-Framework, das die Mamba-Architektur nutzt, um multimodale Unsicherheit in der visuell-inertialen Zustandsabschätzung effektiv zu quantifizieren und dabei im Vergleich zu bestehenden Methoden überlegene Zuverlässigkeit und Robustheit demonstriert.

Ursprüngliche Autoren: Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie fahren mit einem Auto in einem dichten Nebel. Sie können die Straße direkt vor sich sehen, doch je weiter Sie in die Ferne blicken, desto verschwommener wird alles. Sie haben ein GPS, aber es funktioniert etwas fehlerhaft. Sie wissen, dass Sie sich bewegen, sind sich jedoch zu 100 % nicht genau sicher, wo Sie sich befinden oder wie schnell Sie fahren.

In der Welt der Roboter und selbstfahrenden Autos nennt man dies Zustandsschätzung (State Estimation). Es ist die Methode des Roboters, um seine Position und Orientierung zu ermitteln. Seit Jahren sind Roboter sehr gut darin geworden, ihren Standort mithilfe von Kameras und Bewegungssensoren zu erraten. Doch es gibt ein großes Problem: Sie wissen nicht, wann sie falsch liegen.

Sie könnten zu 99 % sicher sein, dass sie am richtigen Ort sind, aber wenn sie tatsächlich zu 100 % falsch liegen, könnten sie einen Unfall verursachen. Sie benötigen eine Möglichkeit zu sagen: „Ich bin mir ziemlich sicher" oder „Ich habe keine Ahnung, bitte seien Sie vorsichtig."

Das Problem: Der „übermütige" Roboter

Aktuelle Roboter sind wie ein Schüler, der eine Prüfung macht, eine Frage falsch beantwortet, diese aber dennoch mit einem selbstbewussten „A" markiert.

  • Visuelle Odometrie (VO) ist so, als würde der Roboter Bilder betrachten, um zu erraten, wo er sich befindet.
  • Inertiale Odometrie ist so, als würde der Roboter seine eigene Bewegung spüren (wie ein Mensch, der sich nach dem Drehen schwindelig fühlt).

Wenn diese beiden voneinander abweichen, oder wenn die Kamera ein verschwommenes Bild sieht (wie ein Fleck auf einem Objektiv) oder der Bewegungssensor ausfällt, fährt der Roboter in der Regel einfach fort zu raten. Er erkennt nicht, dass sich die Bedingungen geändert haben. Ihm fehlt Unsicherheitsquantifizierung – die Fähigkeit zu messen, wie sehr er seinem eigenen Raten vertrauen sollte.

Die Lösung: MUSE (Die „zweite Meinung" des Roboters)

Die Autoren dieses Papers haben ein neues System namens MUSE (Multimodal Uncertainty Quantification of State Estimation) entwickelt.

Stellen Sie sich MUSE als einen superklaren Co-Piloten vor, der neben dem Hauptnavigationssystem des Roboters sitzt.

  1. Es beobachtet alles: Während das Hauptsystem des Roboters möglicherweise nur die Kamera betrachtet, betrachtet MUSE alles gleichzeitig: die Kamerabilder, die Bewegungssensoren (IMU) und die Geschwindigkeitsdaten des Roboters.
  2. Es erkennt Probleme: Wenn die Kamera ein verschwommenes Bild sieht (wie einen Fleck), der Bewegungssensor jedoch sagt: „Hey, wir haben gerade angehalten", bemerkt MUSE diesen Konflikt. Es ist wie ein Detektiv, der feststellt, dass die Geschichte eines Zeugen nicht mit den physischen Beweisen übereinstimmt.
  3. Es gibt einen Vertrauenswert aus: Anstatt nur einen Standort anzugeben, sagt MUSE: „Hier ist, wo Sie sind, UND hier ist ein „Vertrauensmesser", der zeigt, wie sehr Sie dieser Zahl vertrauen sollten."
  4. Es korrigiert den Fehler: Wenn der Roboter von der Kurslinie abdriftet, warnt MUSE ihn nicht nur; es schiebt die Position des Roboters tatsächlich dorthin zurück, wo sie sein sollte.

Funktionsweise: Das „Mamba"-Gehirn

Um dies in Echtzeit zu tun (ohne den Roboter zu verlangsamen), verwendet MUSE eine spezielle Art von KI-Gehirn namens Mamba.

  • Der alte Weg (Transformer): Stellen Sie sich vor, Sie versuchen, sich an eine lange Geschichte zu erinnern, indem Sie jedes Mal, wenn Sie einen Satz wiedergeben möchten, das ganze Buch lesen. Es ist genau, aber sehr langsam und schwerfällig.
  • Der Mamba-Weg: Mamba ist wie ein Bibliothekar, der sofort einen langen Bücherregal durchsuchen kann, die wichtigen Teile merkt und die irrelevanten vergisst. Es ist unglaublich schnell und effizient bei der Verarbeitung langer Datenströme (wie eines Video-Feeds von einer Drohne).

Dies ermöglicht es MUSE, eine Abfolge von Ereignissen über die Zeit hinweg zu betrachten. Es kann sagen: „Die Kamera war vor 5 Sekunden in Ordnung, aber vor 2 Sekunden ist der IMU-Sensor ausgefallen, und jetzt ist das Bild verschwommen. Daher sollte mein Vertrauen in den aktuellen Standort sinken."

Die Ergebnisse: Ein besserer Navigator

Die Forscher testeten MUSE an zwei Arten von Daten:

  1. Standardtests: Unter Verwendung öffentlicher Datensätze, bei denen Roboter in Indoor-Arenen flogen.
  2. Schwieriger Modus: Unter Verwendung ihres eigenen neuen Datensatzes namens UnCal-Flight, der knifflige Situationen wie plötzliche Bewegungen, wechselnde Lichtverhältnisse und Personen enthielt, die vor den Sensoren vorbeigingen.

Die Ergebnisse waren eindeutig:

  • Bessere Genauigkeit: MUSE korrigierte die Position des Roboters besser als frühere Methoden, insbesondere wenn der Roboter verwirrt war.
  • Ehrliches Vertrauen: Wenn sich der Roboter in einer kniffligen Situation befand (wie bei einem verschwommenen Bild), senkte MUSE seinen Vertrauenswert korrekt. Andere Methoden blieben auch dann übermütig, wenn sie falsch lagen.
  • Geschwindigkeit: Es läuft schnell genug, um als „Plugin" für bestehende Robotersysteme verwendet zu werden, ohne einen Supercomputer zu benötigen.

Das Fazit

MUSE ist so, als würde man einem Roboter ein „Bauchgefühl" für seine eigene Navigation geben. Es kombiniert alle Sinne des Roboters, um zu erkennen, wenn etwas schiefgeht, korrigiert den Pfad des Roboters und sagt dem Roboter ehrlich, wann er sich Sorgen machen sollte. Dies macht Roboter sicherer und zuverlässiger, besonders in der chaotischen, unvorhersehbaren realen Welt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →