← Nieuwste papers
⚡ electrical engineering

An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers

Dit artikel introduceert een open-source, twee-traps computer vision-pipeline die RT-DETR en Vision Transformers combineert om zes fijnmazige voertuigcarrosserietypen die relevant zijn voor de veiligheid van fietsers nauwkeurig te classificeren, voorzien van een op vertrouwen gebaseerd onthoudingsmechanisme dat een hoge robuustheid behoudt over verschillende opnamelocaties terwijl stille misclassificaties worden voorkomen.

Oorspronkelijke auteurs: Gandhimathi Padmanaban, Fred Feng

Gepubliceerd 2026-06-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gandhimathi Padmanaban, Fred Feng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme stapel post probeert te sorteren. Sommige brieven zijn duidelijk gemarkeerd als "Krant", sommige als "Tijdschrift" en sommige als "Reclame". Maar je hebt ook duizenden enveloppen die van alles kunnen zijn: een verjaardagskaart, een rekening, een flyer of een brief van een advocaat. Als je gewoon gokt, kun je fouten maken.

Dit artikel beschrijft een nieuwe, open-source "robot-sorter" die ontworpen is om videobeelden van straten te bekijken en voertuigen in zeer specifieke categorieën in te delen, niet alleen in de brede categorieën die we gewoonlijk zien.

Zo werkt het systeem, onderverdeeld in eenvoudige stappen:

1. Het Probleem: Waarom we een betere sorter nodig hebben

Momenteel kennen de meeste verkeerscamera's en veiligheidsstudies alleen het verschil tussen een "auto", een "vrachtwagen" of een "bus". Maar voor de veiligheid van fietsers is dit niet voldoende.

  • De Analogie: Stel je voor dat een fietser wordt geraakt. Als een kleine sedan een fietser raakt, is dat erg. Maar als een hoge SUV of een enorme commerciële vrachtwagen een fietser raakt, is het letsel vaak veel erger omdat de voorkant van het voertuig hoger is en de fietser anders raakt.
  • Het Gat: We moeten precies weten wat voor soort voertuig er langs een fietser rijdt (bijv. is het een Minivan of een Grote Van? Is het een Pickup of een Commerciële Vrachtwagen?). Bestaande tools kunnen het verschil tussen deze specifieke typen niet zien in echte, rommelige video.

2. De Oplossing: Een Tweestaps "Detective Team"

De auteurs hebben een tweestaps systeem gebouwd, zoals een team van twee detectives die samenwerken.

Detective #1: De Snelle Verkenner (RT-DETR)

  • Taak: Deze detective scant de video snel. Hij hoeft niet precies te weten welk model auto het is; hij moet alleen zeggen: "Hé, daar is een voertuig!" en er een kader omheen tekenen.
  • Specialiteit: Hij is erg goed in het opsporen van alles wat op een auto, vrachtwagen, bus of motor lijkt. Hij gebruikt een vooraf getraind brein, dus hij hoefde niet vanaf nul te leren hoe hij auto's moet herkennen.
  • Filter: Als hij een bus of motor ziet, stopt hij daar. Als hij een "auto" of "vrachtwagen" ziet, geeft hij het werk door aan Detective #2.

Detective #2: De Expert-Classificator (Vision Transformer)

  • Taak: Deze detective neemt de specifieke "crop" (het plaatje binnen het kader) van Detective #1 en bekijkt deze heel nauwkeurig.
  • Specialiteit: Dit is de fijnmazige expert. Hij sorteert het voertuig in een van zes specifieke categorieën:
    1. Personenauto
    2. SUV
    3. Pickup Truck
    4. Minivan
    5. Grote Van
    6. Commerciële Vrachtwagen
  • De "Ik weet het niet"-knop: Dit is het belangrijkste onderdeel. Als het plaatje wazig is, de hoek vreemd is, of het voertuig gedeeltelijk verborgen is, kan deze detective onzeker zijn. In plaats van te gokken en mogelijk een fout te maken, heeft hij een regel: "Als ik minder dan 60% zeker ben, zal ik 'Onbekend' zeggen."
    • Waarom dit belangrijk is: In veiligheidsonderzoek is het beter om te zeggen "Ik weet het niet" dan om vol vertrouwen te zeggen "Dat is een pickup truck" terwijl het eigenlijk een minivan is. Dit voorkomt "stille fouten".

3. De Training: Hoe ze de robot hebben geleerd

Leren om het verschil te zien tussen een "Grote Van" en een "Commerciële Vrachtwagen" is moeilijk omdat er in standaard datasets heel weinig foto's van die specifieke vrachtwagens zijn.

  • De Mix: De onderzoekers bouwden een aangepaste trainingsbibliotheek door drie dingen te mengen:
    1. Studiofoto's: Hoogwaardige foto's van auto's uit een beroemde dataset (Stanford Cars).
    2. Web Scraping: Ze verzamelden foto's van vans en vrachtwagens van het internet.
    3. Echte Straatfragmenten: Ze namen werkelijke videoclips uit Ann Arbor, Michigan, en knipten de voertuigen eruit om de robot te laten zien hoe echte, rommelige straatomstandigheden eruitzien (wazig, zijwaarts, gedeeltelijk verborgen).
  • De Disbalans: De robot zag veel meer foto's van gewone auto's en SUV's dan van grote vrachtwagens. Om dit op te lossen, werd het trainingsproces aangepast zodat er extra aandacht werd besteed aan de zeldzame foto's van vrachtwagens, zodat de robot ze niet zou negeren.

4. De Resultaten: Hoe goed werkte het?

Het team testte deze robot op twee verschillende soorten video.

Test 1: Het "Thuisveld" (In-Distribution)

  • De Opstelling: Ze testten het op video van dezelfde straat waar ze de trainingsfragmenten hadden opgenomen (Ann Arbor).
  • De Score: Het behaalde 94% correctheid.
  • De Details: Het was geweldig in het opsporen van SUV's (97% nauwkeurigheid). Het was ook erg goed in personenauto's en pickups. Het enige moment waarop het moeite had, was wanneer het voertuig moeilijk te zien was, en het gebruikte toen correct zijn "Ik weet het niet"-knop in plaats van foutief te gokken.

Test 2: Het "Uitwedstrijd" (Out-of-Distribution)

  • De Opstelling: Ze testten het op video van een totaal andere locatie, gemaakt met een speciale onderzoeksfiets met andere camera's en belichting. Ze hebben de robot niet opnieuw getraind voor deze nieuwe locatie.
  • De Score: Het behaalde 89% correctheid.
  • De Details: Dit is een zeer sterk resultaat voor een systeem dat niet opnieuw is getraind voor een nieuwe plek.
    • SUV's en Pickups bleven zeer nauwkeurig.
    • Minivans werden iets lastiger. De nauwkeurigheid daalde, maar vooral omdat de robot voorzichtiger werd. De robot begon vaker "Onbekend" te zeggen (25% van de tijd) omdat de minivans er anders uitzagen in de nieuwe video. Het begon niet wild te gokken; het gaf simpelweg toe dat het onzeker was.

5. Waarom dit ertoe doet

  • Het is Open Source: De auteurs hebben alle code, het getrainde robotbrein en de data gratis vrijgegeven. Iedereen kan het downloaden en gebruiken om eigen straatvideo's te analyseren.
  • Veiligheid Eerst: Door onderscheid te maken tussen een kleine auto en een grote vrachtwagen, kunnen stadsplanners en veiligheidsonderzoekers eindelijk begrijpen welk type voertuigen precies fietsers in gevaar brengt.
  • Geen Handmatig Werk: Voorheen moesten mensen uren aan video bekijken om deze voertuigen te tellen. Nu kan dit hulpmiddel het automatisch doen.

Kortom: Het artikel presenteert een slimme, gratis tool die werkt als een tweestapsfilter. Eerst vindt het de auto's. Daarna sorteert het ze zorgvuldig in specifieke typen. Als het het niet zeker weet, geeft het dat toe, zodat de veiligheidsgegevens niet worden vervuild door slechte gokken. Het werkt goed, zelfs op nieuwe straten zonder dat het opnieuw getraind hoeft te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →