← Nieuwste papers
💻 computer science

CLFTv2: Efficient Camera-LiDAR Fusion for Semantic Segmentation via Hierarchical Feature Pyramids

CLFTv2 is een efficiënt camera-LiDAR-fusiekader voor semantische segmentatie dat de globale ViT-attention vervangt door een hiërarchische Swin-gebaseerde encoder en een lichtgewicht decoder om de detectie van kwetsbare weggebruikers en de doorvoer aanzienlijk te verbeteren, terwijl de computationele kosten worden verminderd in vergelijking met query-gebaseerde en globale-attention alternatieven.

Oorspronkelijke auteurs: Toomas Tahves, Mauro Bellone, Raivo Sell

Gepubliceerd 2026-09-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Toomas Tahves, Mauro Bellone, Raivo Sell

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Autonome voertuigen vertrouwen op een constante stroom van sensorische gegevens om door de wereld te navigeren, maar zien is niet hetzelfde als begrijpen. Om veilig te kunnen rijden, moet een auto het onderscheid kunnen maken tussen een geschilderde lijn op de weg en een voetganger die van de stoeprand stapt, zelfs wanneer die persoon klein, ver weg of gedeeltelijk verborgen is. Camera's bieden rijke kleur en textuur, waardoor het voertuig vormen en borden kan herkennen, maar ze kunnen afstand niet met zekerheid meten. Lidar, een op lasers gebaseerd scansysteem, biedt nauwkeurige driedimensionale geometrie en brengt de vorm van objecten in de ruimte in kaart, maar produceert vaak schaarse gegevens die steeds leger worden naarmate de afstand groter wordt. Jarenlang hebben ingenieurs geprobeerd deze twee verschillende stromen informatie samen te voegen tot één betrouwbaar beeld. De uitdaging ligt in het verwerken van deze enorme hoeveelheid gegevens snel genoeg voor real-time rijden, terwijl ervoor wordt gezorgd dat de meest kritieke doelwitten, zoals voetgangers en fietsers, nooit worden gemist.

Onderzoekers Toomas Tahves, Mauro Bellone en Raivo Sell hebben een nieuwe aanpak voor dit probleem geïntroduceerd genaamd CLFTv2. Hun werk richt zich op een specifiek type kunstmatige intelligentie-architectuur die ontworpen is om camera- en Lidar-gegevens efficiënter te combineren dan eerdere methoden. In het verleden gebruikten sommige toonaangevende systemen een mechanisme dat bekend staat als een globaal aandachtnetwerk (global attention network), dat probeert naar elk deel van een afbeelding en elk deel van de 3D-scan tegelijkertijd te kijken om verbanden te vinden. Hoewel krachtig, is deze methode rekenintensief en vereist het enorme rekenkracht, wat de computer van een voertuig kan vertragen. De auteurs stelden voor om dit globale overzicht te vervangen door een hiërarchisch, venstergebaseerd systeem. In plaats van de hele scène in één keer te scannen, breekt hun model de afbeelding af in kleinere, verschuivende vensters, waarbij eerst lokale details worden verwerkt en vervolgens een breder begrip wordt opgebouwd. Deze structuur bootst na hoe het menselijk zicht vaak werkt, waarbij de focus eerst ligt op de directe omgeving voordat deze wordt geïntegreerd in een grotere context.

Het team testte dit nieuwe framework over drie belangrijke rijdatasets die verschillende omgevingen vertegenwoordigen: de Zenseact Open Dataset uit Zweden, de Waymo Open Dataset uit de Verenigde Staten en de ISEAuto-dataset uit Estland. Deze datasets variëren in weer, wegomstandigheden en de manier waarop de gegevens zijn gelabeld, wat een rigoureuze test vormt voor de aanpasbaarheid van het systeem. De resultaten toonden aan dat CLFTv2 kwetsbare weggebruikers met hoge betrouwbaarheid identificeerde. Op de Waymo-dataset behaalde het systeem een prestatiescore van 61,7 procent, een significante verbetering ten opzichte van eerdere versies van soortgelijke technologie. Op de ZOD-dataset bereikte het 53,5 procent, een opmerkelijke sprong die specifiek de detectie van voetgangers en verkeersborden verbeterde. Misschien wel het belangrijkste is dat het nieuwe systeem dit deed terwijl het veel minder rekenkracht gebruikte dan zijn concurrenten. Het vereiste ongeveer de helft van de energie van sommige bestaande hoogwaardige modellen en verwerkte gegevens meer dan twee keer zo snel, wat het een praktischere keuze maakt voor de beperkte hardware die in een echte auto te vinden is.

De studie onthulde echter ook een genuanceerde afweging in de manier waarop deze systemen informatie verwerken. Hoewel de venstergebaseerde aanpak zeer efficiënt en effectief bleek op de meeste datasets, ontdekten de onderzoekers dat op de Waymo-dataset, die extreem dichte en gedetailleerde Lidar-scans bevat, een systeem met een globaal, alziend overzicht nog steeds een licht voordeel had in het fuseren van de twee datatypen. De lokale vensters van het nieuwe systeem hadden soms moeite om de punten volledig te verbinden in dergelijke dichte geometrische omgevingen vergeleken met de globale methode. Dit suggereert dat hoewel de nieuwe architectuur een grote stap voorwaarts is qua efficiëntie, de perfecte oplossing uiteindelijk een hybride aanpak zou kunnen vereisen die de snelheid van lokale verwerking combineert met het brede bereik van globale aandacht.

De onderzoekers onderzochten ook hoe het systeem omgaat met verschillende soorten datatoezicht (data supervision). In sommige datasets werden de grondwaarheid-labels gegenereerd door andere algoritmen in plaats van menselijke annotatoren, wat een laag van onzekerheid introduceert. Ondanks dit leerde het nieuwe model goed te generaliseren, wat aantoont dat het vermogen om visuele en geometrische aanwijzingen te combineren robuust is, zelfs wanneer de trainingsdata imperfect is. De studie bevestigt dat voor de specifieke taak van het identificeren van kleine, kritieke objecten zoals voetgangers, een zorgvuldig ontworpen, lichtgewicht fusiesysteem veel zwaardere, complexere modellen kan overtreffen. Door de detectie van kwetsbare weggebruikers prioriteit te geven, zorgt het systeem ervoor dat veiligheid het primaire doel blijft, zelfs naarmate de computationele eisen van autonoom rijden blijven groeien. Het werk demonstreert dat in de race om veiligere zelfrijdende auto's te bouwen, een gerichte, efficiënte aanpak soms effectiever is dan een brute-force poging om alles tegelijkertijd te zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →