← Nieuwste papers
💻 computer science

A Lightweight Small Object Detection Framework Based on Enhanced BiFPN and Attention Mechanisms

Dit artikel stelt ESW-YOLO voor, een lichtgewicht framework voor detectie van kleine objecten gebaseerd op YOLO11n dat Dynamic Snake Convolution, een verbeterde BiFPN met een extra high-resolution head en iEMA attention, en WIoU loss integreert om de detectie nauwkeurigheid op kleine en langgerekte doelwitten aanzienlijk te verbeteren terwijl een vergelijkbaar aantal parameters behouden blijft.

Oorspronkelijke auteurs: Kunpeng Feng, Weihua Bao

Gepubliceerd 2026-09-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kunpeng Feng, Weihua Bao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het uitgestrekte landschap van computer vision, waar machines leren de wereld te zien, bestaat een hardnekkige en koppige uitdaging: het opsporen van de kleine dingen. Terwijl moderne systemen gemakkelijk een auto of een persoon in een foto kunnen identificeren, struikelen ze vaak wanneer het doelwit een stofje, een haarscheurtje of een ver vliegtuig is. Deze moeilijkheid ontstaat omdat deep learning-systemen, die de menselijke hersenen nabootsen in hun vermogen om patronen te herkennen, werken door afbeeldingen progressief te verkleinen om brede vormen te vinden. In dit proces van vereenvoudiging verdwijnen de weinige pixels die een klein object vormen vaak of worden ze te zwak om nuttig te zijn. Bovendien zijn de wiskundige regels die deze systemen gebruiken om te beoordelen hoe goed ze een object hebben gevonden, vaak afgestemd op grotere, meer regelmatige vormen, wat hen onbetrouwbaar maakt wanneer het doelwit een minuscuul, langwerpig stipje is. Het oplossen van dit probleem is cruciaal voor veiligheid en efficiëntie in de echte wereld, van het waarborgen van de structurele integriteit van geproduceerde printplaten tot het monitoren van afgelegen landschappen op gevaren.

Onderzoekers Kunpeng Feng en Weihua Bao van de Shanghai University of Electric Power hebben een nieuwe aanpak voor dit probleem voorgesteld door een systeem te creëren dat zij ESW-YOLO noemen. Gebouwd op een populair en efficiënt detectiekader bekend als YOLO11, is hun werk specifiek ontworpen om deze ongrijpbare kleine objecten te vangen zonder dat daarvoor enorme rekenkracht nodig is. Het team heeft niet simpelweg bestaande instellingen aangepast; ze hebben drie kernonderdelen van het "zicht" van de machine opnieuw vormgegeven om beter aan te sluiten bij de unieke aard van kleine doelwitten. Ten eerste hebben ze de standaardmanier waarop het systeem een afbeelding scant vervangen door een techniek genaamd Dynamic Snake Convolution. In tegen tegenstelling tot een traditionele camera die naar een vast rooster van pixels kijkt, stelt deze nieuwe methode het systeem in staat om zijn focus te buigen en te vervormen, waarbij het de contouren van een object volgt als een slang die een pad volgt. Dit is bijzonder nuttig voor kleine, dunne defecten die anders door een rigide, rechthoekige scan gemist zouden worden.

Ten tweede hebben de onderzoekers het interne netwerk herontworpen dat verschillende lagen visuele informatie combineert. In standaard systemen worden details op hoog niveau vaak vermengd met details op laag niveau op een manier die de zwakke signalen van kleine objecten kan wegwassen. Het team introduceerde een nieuwe structuur, die ze EBPN noemden, die een speciale laag voor hoogwaardige weergave toevoegt die specifelijk gericht is op kleine doelwitten. Deze laag wordt vergezeld door een gespecialiseerd aandachtmechanisme dat werkt als een spotlight, waardoor het systeem gedwongen wordt om meer aandacht te besteden aan de meest relevante kenmerken terwijl de achtergrondruis wordt genegeerd. Ten slotte hebben ze het scoresysteem gewijzigd waarmee de machine leert van haar fouten. Het oorspronkelijke systeem gebruikte een regel die fouten bestrafte op basis van de proporties van de vorm, een regel die de machine vaak in verwarring bracht bij het werken met kleine, uitgerekte objecten. De onderzoekers vervingen dit door een nieuwe scoringsmethode die zich richt op hoe ver het gedetecteerde object van zijn ware centrum verwijderd is, wat een duidelijkere en stabielere gids biedt voor het systeem om zijn nauwkeurigheid te verbeteren.

Bij tests op twee verschillende sets afbeeldingen — één met microscopische defecten op printplaten en een andere met kleine door mensen gemaakte objecten in luchtfoto's voor remote sensing — toonde het nieuwe systeem een significante sprong in prestaties. Op de dataset van de printplaten, waar de defecten vaak niet groter waren dan een dozijn pixels breed, verbeterde het nieuwe model zijn vermogen om objecten correct te identificeren met 12,7 procentpunten vergeleken met de standaardversie waarop het gebaseerd was. Dit vertegenwoordigt een relatieve verbetering van meer dan 20 procent, een aanzienlijke winst in een veld waar vooruitgang vaak wordt gemeten in fracties van een procent. Het systeem behield ook een vergelijkbaar aantal interne parameters, wat betekent dat het niet aanzienlijk zwaarder of complexer werd om te draaien, hoewel het wel iets meer rekenkracht vereiste om de extra hoogwaardige details te verwerken.

De studie onthulde verder dat deze verbeteringen niet alleen het resultaat waren van het toevoegen van meer onderdelen, maar van hoe die onderdelen samenwerkten. Wanneer de onderzoekers de componenten afzonderlijk testten, ontdekten ze dat de nieuwe scoringsmethode alleen slechts een minimale boost bood, en dat de flexibele scanningsmethode eigenlijk slechter presteerde op zichzelf zonder de andere upgrades. Het was pas toen de flexibele scanning, de hoogwaardige weergave-laag en de nieuwe scoringsmethode werden gecombineerd, dat het systeem echt uitblonk en zelfs veel grotere en complexere modellen versloeg die drie tot vier keer zoveel interne parameters hadden. In de remote sensing-tests bleek het systeem bijzonder bekwaam in het identificeren van speeltuinen in luchtfoto's, een categorie waarin het zijn dichtstbijzijnde concurrenten met een ruime marge versloeg, waarschijnlijk door zijn vermogen om de variërende texturen en vormen te verwerken die in dergelijke omgevingen voorkomen.

Hoewel het nieuwe framework een krachtige oplossing biedt voor het vinden van kleine objecten, erkennen de onderzoekers een afruil. De toevoeging van de hoogwaardige weergave-laag verhoogde de computationele kosten, waardoor het systeem iets langzamer wordt bij het draaien op apparaten met beperkte middelen zoals mobiele telefoons of drones. De resultaten suggereren echter dat voor toepassingen waarbij het missen van een klein defect kostbaar of gevaarlijk kan zijn, deze extra kosten een waardevolle investering zijn. Het werk biedt een duidelijk pad voorwaarts om de machinevisie gevoeliger te maken voor de kleine details die er toe doen, en bewijst dat door aan te passen hoe een systeem naar de wereld kijkt, we dingen kunnen zien die voorheen onzichtbaar waren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →