← Nieuwste papers
💻 computer science

UAD-YOLO: An Efficient Context-Aware and Shape-Aware Framework Based on YOLOv11 for Urban Anomaly Detection in Complex Scenes

Dit artikel presenteert UAD-YOLO, een efficiënt op YOLOv11 gebaseerd framework dat is verbeterd met Large Separable Kernel Attention, Reparameterised Convolution en Shape-IoU loss om hoge nauwkeurigheid en real-time detectie van stedelijke anomalieën in complexe scènes te bereiken, gevalideerd door een nieuwe dataset en superieure prestatiecijfers ten opzichte van baseline-modellen.

Oorspronkelijke auteurs: Chen Shiying

Gepubliceerd 2026-09-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chen Shiying

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Steden zijn levende systemen, die voortdurend verschuiven en veranderen, maar ze vertrouwen op een gestaag ritme van onderhoud om veilig te blijven. Wanneer een weg scheurt, een boom valt of een bord beschadigd raakt, kunnen de gevolgen variëren van klein ongemak tot ernstig gevaar. Decennialang was het in de gaten houden van deze stedelijke gevaren een taak voor menselijke inspecteurs, die door buurten liepen of reden om problemen op te sporen. Deze methode is traag, duur en mist vaak kleine of verborgen problemen. In de afgelopen jaren hebben wetenschappers de hulp ingeroepen van computers om hen te leren deze problemen te "zien" via camera's. Dit vakgebied, bekend als objectdetectie, stelt machines in staat om afbeeldingen te scannen en specifieke items te identificeren, van auto's tot kuilen in de weg. Het is echter veel moeilijker om een computer te leren een grillige scheur in een drukke straat te spotten dan een auto op een leeg parkeerterrein te vinden. De achtergrond is rommelig, het licht verandert en de objecten zelf zijn vaak onregelmatig, beschadigd of gedeeltelijk verborgen.

Een nieuwe studie van onderzoekers aan de Sichuan Vocational and Technical University of Communications pakt deze moeilijkheden aan door een slimmere manier te creëren waarop computers onze steden kunnen observeren. Het team ontwikkelde een systeem genaamd UAD-YOLO, dat specifiek is ontworpen om een breed scala aan stedelijke problemen in realtime te vinden. In plaats van alleen te zoeken naar vormen die lijken op standaard dozen, is dit systeem gebouwd om de rommelige, complexe realiteit van een stadsstraat te begrijpen. Het kan zeven verschillende soorten anomalieën opsporen, waaronder wegscheuren, kuilen, beschadigde verkeersborden, gevallen bomen, afval, graffiti en kapotte nutspalen. De onderzoekers vertrouwden niet alleen op bestaande gegevens; ze bouwden een nieuwe, grote collectie afbeeldingen met duizenden voorbeelden van deze specifieke problemen om de computer te leren waar hij naar moet zoeken. Door verschillende geavanceerde technieken te combineren, creëerden ze een hulpmiddel dat zowel zeer nauwkeurig is als snel genoeg om op standaard apparatuur te draaien, wat het een praktische oplossing maakt voor continue stedelijke monitoring.

De kernuitdaging waar de onderzoekers voor stonden, was dat stedelijke anomalieën er niet uitzien als nette, perfecte objecten. Een wegscheur kan meters lang zijn in een dunne, kronkelende lijn, terwijl een hoop vuilnis een amorfe vlek kan zijn. Traditionele computervisie-instrumenten worstelen vaak met deze onregelmatige vormen, vooral wanneer ze worden omringd door andere afleidingen zoals schaduwen, andere voertuigen of complexe texturen. Om dit op te lossen, heeft het team een krachtig bestaand detectiekader aangepast, bekend als YOLOv11, dat beroemd is om zijn snelheid. Ze voegden drie specifieke verbeteringen toe om de computer te helpen meer te "denken" als een menselijke waarnemer. Ten eerste gaven ze het systeem een betere manier om naar het grote plaatje te kijken. Door een techniek te gebruiken waarmee de computer langetermijnverbindingen in een afbeelding kan zien, kan het begrijpen hoe een kleine scheur zich verhoudt tot het grotere wegdek, in plaats van alleen een willekeurige lijn te zien. Dit helpt het systeem om achtergrondruis te negeren en zich te concentreren op wat er echt toe doet.

Ten tweede verbeterden de onderzoekers hoe de computer naar fijne details kijkt. Ze introduceerden een methode die het systeem toestaat om complexe texturen te leren tijdens de trainingsfase, maar de structuur vervolgens te vereenvoudigen wanneer het daadwerkelijk werkt. Dit is vergelijkbaar met hoe een student kan studeren met veel aantekeningen en diagrammen, maar vervolgens een toets aflegt met alleen een gestroomlijnde mentale kaart. Deze aanpak zorgt ervoor dat de computer kleine details kan spotten, zoals een klein kuiltje of een vage kras, zonder het proces te vertragen. Ten derde veranderden ze de manier waarop de computer de box rond een gedetecteerd object tekent. Standaardmethoden dwingen deze boxen vaak in rigide vormen, wat onnauwkeurig kan zijn voor onregelmatige items. Het nieuwe systeem gebruikt een flexibelere aanpak die de werkelijke vorm van het object respecteert, of het nu lang en dun of kort en breed is, waardoor de locatie nauwkeurig wordt gemarkeerd.

Om te testen of deze wijzigingen werkten, trainden de onderzoekers hun systeem op een nieuwe dataset die zij zelf hadden gemaakt, welke meer dan 17.000 afbeeldingen van stedelijke scènes bevatte. Ze testten het systeem tegen andere populaire detectiemethoden en ontdekten dat hun nieuwe aanpak aanzienlijk beter was in het vinden van de juiste objecten terwijl ze er minder van misten. In hun tests identificeerde het systeem stedelijke anomalieën correct in 83,1% van de gevallen waarin ze gevonden hadden te moeten worden, een opmerkelijke verbetering ten opzichte van de standaardmodellen. Het slaagde er ook in om 77,1% van alle werkelijke problemen in de afbeeldingen te vinden, een belangrijke metriek voor veiligheidstoepassingen waarbij het missen van een gevaar gevaarlijk is. Misschien wel het belangrijkste voor echt gebruik: het systeem bleef ongelooflijk snel. Het kon een afbeelding verwerken en een antwoord geven in slechts 2,31 milliseconden, wat betekent dat het theoretisch honderden afbeeldingen per seconde kan analyseren. Deze snelheid suggereert dat de technologie kan worden geïnstalleerd op bewegende voertuigen of drones om stadsstraten continu te monitoren zonder vertraging.

De studie onderzocht ook hoe verschillende instellingen de prestaties van het systeem beïnvloedden, en bevestigde dat de specifieke combinatie van technieken die zij kozen de meest effectieve was. Ze ontdekten dat het gebruik van een gemiddelde grootte voor het "langetermijnzicht" cruciaal was; te nauw kijken betekende dat de context werd gemist, terwijl te breed kijken te veel verwarring introduceerde. Evenzo ontdekten ze dat de meest flexibele vormdetectie-instellingen het beste werkten voor de onregelmatige aard van stedelijke schade. Hoewel het systeem niet perfect is en nog steeds in de war kan worden gebracht door extreem licht of zware obstructie, laten de resultaten een duidelijke weg vooruit zien. De onderzoekers erkennen dat meer testen in verschillende weersomstandigheden en locaties nodig is, maar de huidige bevindingen laten zien dat een computer nu getraind kan worden om de subtiele, gebroken en rommelige details van het stedelijke leven te zien met een niveau van nauwkeurigheid en snelheid dat voorheen onbereikbaar was. Dit werk biedt een veelbelovend hulpmiddel voor steden om van reactief herstel naar proactieve veiligheid te gaan, waarbij wordt gewaarborgd dat de infrastructuur waarop we vertrouwen, wordt bewaakt met een constante, onblikkerige blik.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →