← Neueste Arbeiten
💻 computer science

CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids

CLFTv2 ist ein effizientes Kamera-LiDAR-Fusionsframework für die semantische Segmentierung, das die globale ViT-Attention durch einen hierarchischen Swin-basierten Encoder und einen leichtgewichtigen Decoder ersetzt, um die Erkennung schwächerer Verkehrsteilnehmer sowie den Durchsatz signifikant zu verbessern und gleichzeitig die Rechenkosten im Vergleich zu abfragesbasierten und globalen Attention-Alternativen zu reduzieren.

Ursprüngliche Autoren: Toomas Tahves, Mauro Bellone, Raivo Sell

Veröffentlicht 2026-09-10
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Toomas Tahves, Mauro Bellone, Raivo Sell

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Autonome Fahrzeuge verlassen sich auf einen stetigen Strom von Sensordaten, um sich in der Welt zu bewegen, aber Sehen ist nicht dasselbe wie Verstehen. Um sicher zu fahren, muss ein Auto zwischen einer auf die Straße gemalten Linie und einem Fußgänger, der vom Bordstein tritt, unterscheiden können, selbst wenn diese Person klein, fern oder teilweise verdeckt ist. Kameras liefern reiche Farben und Texturen, die es dem Fahrzeug ermöglichen, Formen und Schilder zu erkennen, aber sie können Entfernungen nicht mit Sicherheit messen. Lidar, ein laserbasiertes Scansystem, liefert eine präzise dreidimensionale Geometrie und bildet die Form von Objekten im Raum ab, produziert jedoch oft spärliche Daten, die mit zunehmender Entfernung immer leerer werden. Jahrelang haben Ingenieure versucht, diese zwei unterschiedlichen Informationsströme zu einem einzigen, zuverlässigen Bild zu verschmelzen. Die Herausforderung besteht darin, diese riesige Menge an Daten schnell genug für das Echtzeitfahren zu verarbeiten und gleichzeitig sicherzustellen, dass die kritischsten Ziele, wie Menschen und Radfahrer, niemals übersehen werden.

Die Forscher Toomas Tahves, Mauro Bellone und Raivo Sell haben einen neuen Ansatz für dieses Problem namens CLFTv2 vorgestellt. Ihre Arbeit konzentriert sich auf eine spezifische Art von KI-Architektur, die darauf ausgelegt ist, Kamera- und Lidar-Daten effizienter zu kombinieren als bisherige Methoden. In der Vergangenheit verwendeten einige führende Systeme einen Mechanismus, der als globales Aufmerksamkeitsnetzwerk (global attention network) bekannt ist, welcher versucht, jeden Teil eines Bildes und jeden Teil des 3D-Scans gleichzeitig zu betrachten, um Verbindungen zu finden. Obwohl dies leistungsstark ist, ist diese Methode rechenintensiv und erfordert enorme Prozessorleistung, was den Computer eines Fahrzeugs verlangsamen kann. Die Autoren schlugen vor, diese globale Sicht durch ein hierarchisches, fensterbasiertes System zu ersetzen. Anstatt die gesamte Szene auf einmal zu scannen, unterteilt ihr Modell das Bild in kleinere, verschiebbare Fenster, wobei zuerst lokale Details verarbeitet werden, bevor ein breiteres Verständnis aufgebaut wird. Diese Struktur ahmt die menschliche Sichtweise nach, die oft zuerst das unmittelbare Umfeld fokussiert, bevor sie es in einen größeren Kontext integriert.

Das Team testete diesen neuen Rahmen über drei große Fahrdatensätze hinweg, die verschiedene Umgebungen repräsentieren: den Zenseact Open Dataset aus Schweden, den Waymo Open Dataset aus den USA und den ISEAuto-Datensatz aus Estland. Diese Datensätze variieren in Bezug auf Wetter, Straßenbedingungen und die Art und Weise, wie die Daten etikettiert wurden, was einen strengen Test für die Anpassungsfähigkeit des Systems darstellt. Die Ergebnisse zeigten, dass CLFTv2 schutzbedürftige Verkehrsteilnehmer mit hoher Zuverlässigkeit identifizierte. Auf dem Waymo-Datensatz erreichte das System einen Leistungswert von 61,7 Prozent, eine signifikante Verbesserung gegenüber früheren Versionen ähnlicher Technologien. Auf dem ZOD-Datensatz erreichte es 53,5 Prozent, einen bemerkenswerten Sprung, der speziell die Erkennung von Fußgängern und Verkehrsschildern verbesserte. Vielleicht am wichtigsten ist, dass das neue System dies bei Verwendung weitaus weniger Rechenleistung im Vergleich zu seinen Konkurrenten tat. Es benötigte etwa halb so viel Energie wie einige bestehende Hochleistungsmodelle und verarbeitete Daten mehr als doppelt so schnell, was es zu einer praktikableren Wahl für die begrenzte Hardware macht, die in einem echten Auto zu finden ist.

Die Studie enthüllte jedoch auch einen nuancierten Kompromiss bei der Art und Weise, wie diese Systeme Informationen verarbeiten. Während der fensterbasierte Ansatz in den meisten Datensätzen hocheffizient und effektiv war, stellten die Forscher fest, dass auf dem Waymo-Datensatz, der extrem dichte und detaillierte Lidar-Scans enthält, ein System mit einer globalen, alles sehenden Sicht immer noch einen leichten Vorteil bei der Fusion der beiden Datentypen hatte. Die lokalen Fenster des neuen Systems hatten es in solch dichten geometrischen Umgebungen manchmal schwerer, die Punkte vollständig miteinander zu verbinden, als die globale Methode. Dies deutet darauf sich hin, dass während die neue Architektur ein großer Schritt nach vorn in Bezug auf die Effizienz ist, die perfekte Lösung letztlich ein hybrider Ansatz sein könnte, der die Geschwindigkeit der lokalen Verarbeitung mit der Reichweite der globalen Aufmerksamkeit kombiniert.

Die Forscher untersuchten auch, wie das System mit verschiedenen Arten der Datenüberwachung umgeht. In einigen Datensätzen wurden die Ground-Truth-Labels von anderen Algorithmen statt von menschlichen Annotatoren erstellt, was eine Ebene der Unsicherheit einführte. Trotz dessen lernte das neue Modell gut zu generalisieren und zeigte, dass seine Fähigkeit, visuelle und geometrische Hinweise zu kombinieren, robust ist, selbst wenn die Trainingsdaten unvollkommen sind. Die Studie bestätigt, dass für die spezifische Aufgabe der Identifizierung kleiner, kritischer Objekte wie Fußgänger ein sorgfältig gestaltetes, leichtgewichtiges Fusionssystem weitaus komplexere Modelle übertreffen kann. Durch die Priorisierung der Erkennung schutzbedürftiger Verkehrsteilnehmer stellt das System sicher, dass die Sicherheit das primäre Ziel bleibt, selbst wenn die Rechenanforderungen für das autonome Fahren weiter wachsen. Die Arbeit zeigt, dass es im Wettlauf um den Bau sichererer selbstfahrender Autos manchmal effektiver ist, einen fokussierten, effizienten Ansatz zu wählen, als mit Brute-Force-Methoden zu versuchen, alles auf einmal zu sehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →