← Neueste Arbeiten
💻 computer science

A Multi-Modal Perception Pipeline for Object Detection and Tracking in Autonomous Racing

Dieses Paper präsentiert eine robuste multimodale Late-Fusion-Perzeptionspipeline, die Kamera-, LiDAR- und RADAR-Daten mit einem spezialisierten Tracking-Framework integriert, um eine zuverlässige Objekterkennung und -verfolgung für autonomes Racing unter Hochgeschwindigkeits-, widrigen und Edge-Case-Bedingungen zu erreichen.

Ursprüngliche Autoren: Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli, Valentina La Gamba, Silvia Severi, Fabio Bagni, Luca Bartoli, Massimiliano Bosi, Francesco Gatti, Micaela Verucchi, Ayoub Raji, Marko Bertogna

Veröffentlicht 2026-09-09
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Davide Malvezzi, Michele Pestarino, Vittoria Cavicchioli, Valentina La Gamba, Silvia Severi, Fabio Bagni, Luca Bartoli, Massimiliano Bosi, Francesco Gatti, Micaela Verucchi, Ayoub Raji, Marko Bertogna

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Autos mit Geschwindigkeiten rasen, die einen Formel-1-Fahrer ins Schwitzen bringen würden, doch hinter dem Steuer sitzt kein Mensch. In dieser extremen Umgebung wird die Fehlermarge in Zoll und Millisekunden gemessen. Bei Geschwindigkeiten von annähernd 80 Metern pro Sekunde bedeutet eine Verzögerung von nur einer Zehntelsekunde, dass ein Auto fast acht Meter weit fährt, ohne zu wissen, wo es sich befindet oder was sich vor ihm befindet. Dies ist die Realität des autonomen Rennsports, eines Feldes, das die Wahrnehmungstechnologie an ihre absolute Grenze treibt. Um dieses Chaos zu bewältigen, muss ein Fahrzeug als seine eigenen Augen und sein eigenes Gehirn agieren und die Strecke ständig scannen, um andere Autos zu finden, deren Bewegungen vorherzusagen und zu entscheiden, wann es beschleunigen, abbremsen oder ausweichen muss. Die Herausforderung besteht nicht nur darin, zu sehen, sondern klar durch Bewegungsunschärfe, vibrierende Sensoren und das plötzliche Erscheinen von Hindernissen zu sehen, während man gleichzeitig unter Bedingungen operiert, die selbst die fortschrittlichsten menschlichen Sinne verwirren würden.

Ein Team von Forschern der Universität Modena und Reggio Emilia hat in Zusammenarbeit mit HiPeRT Srl ein neues System entwickelt, das diese Probleme für die Abu Dhabi Autonomous Racing League 2025 lösen soll. Ihre Arbeit, die in einer kürzlich veröffentlichten Arbeit präsentiert wurde, konzentriert sich auf eine „Perzeptions-Pipeline“ – eine komplexe Kette aus Software und Hardware, die Rohdaten von den Sensoren des Autos in eine zuverlässige Karte der Welt verwandelt. Der Ansatz des Teams basiert auf der Idee, dass kein einzelner Sensortyp perfekt ist. Kameras sind exzellent darin, Formen zu erkennen, haben aber Schwierigkeiten mit der Distanz bei Dunkelheit oder schlechtem Wetter. LiDAR-Sensoren, die Laserimpulse nutzen, um eine 3D-Karte zu erstellen, sind präzise, können aber durch Staub oder Regen überfordert werden. RADAR-Einheiten sind großartig darin, die Geschwindigkeit zu messen, lassen aber oft Details vermissen. Die Forscher erkannten, dass ein Auto, um das Hochgeschwindigkeits-Chaos eines Rennens zu überleben, all diese Sinne zu einer einzigen, einheitlichen Sicht kombinieren muss – eine Methode, die sie „Late Fusion“ nennen. Das bedeutet, dass das Auto die Daten jedes Sensors zuerst unabhängig voneinander verarbeitet und dann die Ergebnisse zusammenführt, um ein vollständiges Bild zu erstellen, anstatt zu versuchen, die Rohdatenströme sofort zu verschmelzen.

Das in dieser Studie verwendete Fahrzeug, der Dallara EAV-24, ist mit einem hochentwickelten Arsenal an Werkzeugen ausgestattet: drei LiDAR-Sensoren, sieben Kameras und vier RADAR-Einheiten, die alle mit einer präzisen Uhr synchronisiert sind. Das System arbeitet so, dass jeder Sensortyp auf eigene Faust nach anderen Autos sucht. Die Kameras verwenden ein neuronales Netzwerk, um die 2D-Umrisse von Fahrzeugn im Videofeed zu erkennen. Die LiDARs scannen die Luft mit Lasern, um 3D-Formen zu finden, während die RADARs die Geschwindigkeit und Präsenz von Objekten basierend auf Radiowellen detektieren. Sobald diese unabhängigen Erkennungen stattgefunden haben, fungiert das „Fusionsmodul“ des Systems als Matchmaker. Es betrachtet die Daten der verschiedenen Sensoren und fragt: „Ist dieser LiDAR-Blob dasselbe Auto wie dieser Kamera-Kasten?“ Wenn das Timing und der Ort übereinstimmen, führt das System sie zusammen und erstellt eine robuste Schätzung darüber, wo sich das andere Auto befindet und wie schnell es sich bewegt. Dieser Prozess ist entscheidend, denn wenn sich das System nur auf einen Sensor verlassen würde, könnte ein vorübergehender Fehler oder ein toter Winkel zu einem katastrophalen Versagen führen. Durch die Kombination stellt das System sicher, dass, falls ein Sensor ausfällt oder blockiert wird, die anderen das Auto sicher halten können.

Das Sehen des Autos ist jedoch nur die halbe Miete; zu wissen, wo es in einem Bruchteil einer Sekunde sein wird, ist die andere Hälfte. Die Forscher fanden heraus, dass bei Renngeschwindigkeiten selbst eine winzige Verzögerung in der Verarbeitung dazu führen kann, dass das Auto glaubt, ein Hindernis sei an einem Ort, während es sich tatsächlich schon mehrere Meter weiter bewegt hat. Um dies zu beheben, enthält ihr Tracking-System einen Mechanismus zur „Verzögerungskompensation“. Es betrachtet den exakten Moment, in dem ein Sensor ein Objekt gesehen hat, und berechnet, wo sich dieses Objekt jetzt befinden muss, wobei die Zeit berücksichtigt wird, die die Daten durch den Computer benötigt haben. Darüber hinaus rät das System nicht einfach; es nutzt ein tiefes Verständnis dafür, wie Rennwagen sich verhalten. Es weiß, dass Autos im Allgemeinen bestimmten Pfaden auf der Strecke folgen, den sogenannten Ideallinien, und dass sie in Kurven langsamer werden und auf Geraden beschleunigen. Indem es dieses Wissen in seine Berechnungen einspeist, kann das System die zukünftige Position eines Autos mit viel größerer Genauigkeit vorhersagen als ein Standard-Tracker, der davon ausgeht, dass Autos sich in geraden Linien mit konstanter Geschwindigkeit bewegen.

Das Team testete dieses System unter realen Bedingungen während des Rennereignisses 2025, wobei ihr autonomes Auto auf dem Yas Marina Circuit gegen andere antrat. Sie unterzogen das System drei spezifischen Hochbelastungsszenarien, um zu sehen, wie es sich behauptet. Im ersten Test simulierten sie ein Auto, das plötzlich auf der Strecke zum Stehen kommt, während sich das autonome Fahrzeug mit hoher Geschwindigkeit näherte. Das System detektierte das stehende Auto aus etwa 80 Metern Entfernung und schätzte innerhalb weniger hundert Millisekunden korrekt ein, dass es sich nicht bewegte, was der Planungssoftware genügend Zeit gab, um sicher zu bremsen oder auszuweichen. Im zweiten Szenario testeten sie, wie das System mit einer „Blind Spot“-Situation umgeht, in der ein Auto die Sicht auf ein anderes blockiert. Als das blockierende Auto sich bewegte, entdeckte das System das neu enthüllte Fahrzeug sofort und begann es ohne Zögern zu verfolgen, was bewies, dass es plötzliche Hindernisse bewältigen kann. Schließlich testeten sie ein Überholmanöver nebeneinander, bei dem zwei Autos nur Zentimeter voneinander entfernt rasten. Während das System eine leichte Tendenz zeigte, die exakte Position des anderen Autos je nachdem, ob es sich vor oder hinter einem befand, einzuschätzen, war die Gesamtgenauigkeit ausreichend, um das Manöver ohne Kollision zu vollenden.

Die Ergebnisse dieser Tests bestätigten, dass die Kombination mehrerer Sensoren der Abhängigkeit von nur einem allein weit überlegen ist. Als die Forscher die LiDAR-Sensoren aus der Gleichung entfernten, sank die Fähigkeit des Systems, die Distanz zu beurteilen, signifikant. Als sie das RADAR entfernten, hatte das System Schwierigkeiten, die Geschwindigkeit anderer Autos genau zu schätzen. Erst wenn alle drei Sensortypen zusammenarbeiteten, erreichte das System das beste Gleichgewicht zwischen Präzision und Reichweite. Die Studie kommt zu dem Schluss, dass autonome Fahrzeuge für den sicheren Betrieb bei extremen Geschwindigkeiten nicht nur die Welt durch viele Augen sehen müssen, sondern auch die Welt in einer Weise denken müssen, die die Physik des Rennsports berücksichtigt. Obwohl das System nicht perfekt ist – es hat immer noch leichte Schwierigkeiten mit der exakten Geometrie eines Autos bei der Seitenansicht –, stellt es einen bedeutenden Fortschritt dar. Es beweist, dass Maschinen durch die Fusion verschiedener Datentypen und das Verständnis des Rennkontextes lernen können, die gefährlichsten und anspruchsvollsten Umgebungen der Erde zu navigieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →