← Neueste Arbeiten
💻 computer science

Joint Enhancement of Multi-Scale Features and Adaptive Loss for YOLOv5

Dieses Paper schlägt ein multidimensionales kollaboratives Erweiterungsframework für YOLOv5 vor, das LAB-Raum-CLAHE, eine hochauflösende P2-Detektionsschicht mit Varifocal Loss sowie deformierbare Konvolution mit Channel Attention integriert, um die Herausforderungen durch schlechte Lichtverhältnisse, kleine Zielobjekte und geometrische Deformationen in der industriellen visuellen Inspektion effektiv zu adressieren und dabei eine überlegene Leistung gegenüber gängigen Detektoren auf einem spezialisierten Sackdatensatz zu erzielen.

Ursprüngliche Autoren: Ming liang Yang, Yu yu miao, Xi jun Xu, heng Yang, qing Dong, Ke yuan Zhao

Veröffentlicht 2026-09-11
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ming liang Yang, Yu yu miao, Xi jun Xu, heng Yang, qing Dong, Ke yuan Zhao

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der industriellen Automatisierung verlassen sich Maschinen auf Kameras, um das zu sehen, was Menschen sehen, aber sie haben oft mit denselben visuellen Problemen zu kämpfen, die auch uns in schwach beleuchteten Räumen Kummer bereiten. Wenn ein Fabrikboden schlecht beleuchtet ist oder wenn ein Produkt zerknittert, gefaltet oder winzig klein ist, können Standard-Computervisionssysteme die Orientierung verlieren. Sie könnten eine kleine Rissstelle in einem Beutel übersehen oder es versäumen, ein beschädigtes Teil zu lokalisieren, weil das Bild zu dunkel oder das Objekt zu verzerrt ist. Hier kommt das Feld der Objekterkennung ins Spiel, ein Zweig der künstlichen Intelligenz, der darauf ausgelegt ist, Computern beizubringen, Gegenstände innerhalb eines Bildes zu identifizieren und zu lokalisieren. Während moderne Systeme leistungsstark sind, geraten sie oft ins Straucheln, wenn sie mit der chaotischen Realität eines Lagers konfrontiert werden: schlechtes Licht, winzige Defekte und Objekte, die nicht perfekt geformt sind. Forscher versuchen ständig, Systeme zu entwickeln, die diese schwierigen Bedingungen bewältigen können, ohne das schnelle Tempo der industriellen Arbeit zu verlangsamen.

Ein Team von Forschern der Taiyuan University of Science and Technology und der Taiyuan Fortucky Logistics Equipment & Technology Co., Ltd. hat diese spezifischen Herausforderungen angegangen, indem sie ein populäres Detektionssystem namens YOLOv5 verbessert haben. Sie konzentrierten ihre Arbeit auf eine besonders knifflige Aufgabe: die Inspektion von industriellen Big Bags, also großen Gewebesäcken, die zum Transport von Schüttgut verwendet werden. Diese Säcke stellen eine perfekte Kombination aus Schwierigkeiten für eine Kamera dar. Unter schlechten Lichtverhältnissen wird die gewebte Textur des Sacks schwer unterscheidbar, und jegliche Beschädigung, wie etwa ein kleines Loch oder ein Riss, ist oft zu klein, um klar gesehen zu werden. Zudem verändern diese Säcke beim Stapeln und Bewegen ihre Form durch Falten und Verdrehen, was Standardkameras verwirrt. Die Forscher setzten sich zum Ziel, eine einzige Lösung zu schaffen, die Dunkelheit bewältigen, winzige Mängel finden und gleichzeitig den wechselnden Formen der Säcke gerecht werden kann.

Um das Problem der schlechten Beleuchtung zu lösen, führte das Team eine Methode ein, die wie eine intelligente Taschenlampe für die Augen des Computers wirkt. Anstatt einfach das gesamte Bild aufzuhellen, was Details überstrahlen oder blendende Stellen erzeugen könnte, verwendeten sie eine Technik, die den Kontrast in kleinen, lokalen Bereichen anpasst. Stellen Sie sich vor, Sie blicken in einen dunklen Raum, in dem einige Ecken stockfinster und andere leicht beleuchtet sind; ein einfaches Aufhellen würde den ganzen Raum weiß erscheinen lassen und die Schatten eliminieren. Die hier verwendete Methode, bekannt als CLAHE, betrachtet winzige Bildabschnitte und verstärkt den Kontrast nur dort, wo er benötigt wird. Dies ermöglicht es dem Computer, die feine Webstruktur des Sacks und die subtilen Unterschiede, die auf einen Riss hindeuten, selbst in sehr dunklen Ecken zu erkennen, während das Rauschen und die Körnung des Bildes unter Kontrolle gehalten werden. Dieser Schritt stellt sicher, dass der Computer ein klares, detailliertes Bild erhält, noch bevor er beginnt, nach Defekten zu suchen.

Sobald das Bild klar ist, muss das System die winzigen beschädigten Bereiche finden, die oft nur wenige Pixel breit sind. Standardmäßige Detektionssysteme übersehen diese kleinen Ziele oft, weil sie Bilder in Schichten verarbeiten, die das Bild schrittweise verkleinern, wodurch kleine Details verloren gehen. Die Forscher fügten dem System eine neue Ebene hinzu, die eine hochauflösende Ansicht des Bildes beibehält, sodass es diese winzigen Mängel erkennen kann, ohne sie in der Unschärfe zu verlieren. Sie änderten auch die Art und Weise, wie das System aus seinen Fehlern lernt. Anstatt jeden Fehler gleich zu behandeln, schenkt die neue Methode den schwer zu findenden kleinen Objekten und denen, bei denen sich das System unsicher ist, besondere Aufmerksamkeit. Diese Kombination aus einer scharfen Nahaufnahme und einem sorgfältigeren Lernen aus schwierigen Beispielen verbesserte die Fähigkeit des Systems, kleine Risse und Löcher zu finden, die es zuvor ignoriert hätte, signifikant.

Die letzte Herausforderung bestand darin, mit den Säcken umzugehen, die sich verdrehen und falten. Eine Standardkameraleinheit sieht die Welt in einem starren Gitter, was gut für gerade Linien funktioniert, aber Schwierigkeiten bekommt, wenn ein Objekt biegt oder sich dehnt. Um dies zu beheben, gaben die Forscher dem System eine flexible Art des Sehens. Sie fügten einen Mechanismus hinzu, der es dem Computer ermöglicht, seine Fokuspunkte leicht zu verschieben, um seine Sicht an die Falten und Kurven des Sacks anzupassen. Dies wird gepaart mit einem System, das lernt, welche Teile des Bildes am wichtigsten sind, was dem Computer effektiv sagt, das Hintergrundrauschen zu ignorieren und sich auf die Form des Schadens zu konzentrieren. Durch die Kombination dieser flexiblen Betrachtung mit einem Fokus auf die relevantesten Merkmale wurde das System viel besser darin, beschädigte Säcke zu erkennen, selbst wenn sie zerknittert oder in seltsamen Winkeln gekippt waren.

Als die Forscher ihr verbessertes System an einer Sammlung von realen Big-Bag-Bildern testeten, waren die Ergebnisse beeindruckend. Unter schlechten Lichtverhältnissen sprang die Fähigkeit des Systems, Schäden zu erkennen, von 65,1 % auf 78,4 %, ein bedeutender Sprung, der bedeutet, dass weit weniger Defekte übersehen werden. Für die kleinsten Ziele stieg die Detektionsrate auf 85,2 %, und für deformierte Säcke erreichte sie 74,3 %. Insgesamt erreichte das neue System eine Genauigkeit von 86,7 % und übertraf damit andere führende Detektionsmodelle wie YOLOv7 und YOLOv8, die jeweils 75,8 % bzw. 78,6 % erreichten. Die Studie zeigt, dass es möglich ist, durch die gleichzeitige Adressierung von Beleuchtung, Skalierung und Form ein robustes Inspektionswerkzeug zu schaffen, das in der komplexen und oft unvollkommenen Umgebung eines Industrielagers zuverlässig arbeitet. Dieser Ansatz bietet einen praktischen Weg nach vorn, um die Qualitätskontrolle in der Logistik und Fertigung zu gewährleisten, wo das Übersehen eines kleinen Defekts später zu erheblichen Problemen führen kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →