← Neueste Arbeiten
⚡ electrical engineering

A Cross-Modal Detection-Segmentation Framework for Video-Based Process Monitoring in Wire Arc Additive Manufacturing

Diese Studie etabliert eine Echtzeit-Computer-Vision-Pipeline für die Drahtwendel-Additive-Fertigung (Wire Arc Additive Manufacturing), die YOLOv8n als den optimalen Detektor für die Schweißüberwachung identifiziert und ein YOLO-gestütztes SAM2-Framework für die Segmentierung vorschlägt, während sie gleichzeitig die aktuellen Einschränkungen von Foundation-Modellen bei der Unterscheidung kontinuierlicher Schweißmerkmale unter extremem Lichtbogenblendlicht hervorhebt.

Ursprüngliche Autoren: Sayak Halder, Shahana Bano, Anil Prathuru, Somasundar Kannan, Shiva Sekar, Deepika Nikam, Sagar Nikam

Veröffentlicht 2026-09-08
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Sayak Halder, Shahana Bano, Anil Prathuru, Somasundar Kannan, Shiva Sekar, Deepika Nikam, Sagar Nikam

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der modernen Fertigung wächst der Wunsch, große, komplexe Metallteile nicht durch das Schneiden aus einem massiven Block, sondern durch das Hinzufügen Schicht für Schicht zu fertigen. Dieser Prozess, bekannt als Drahtlichtbogen-Additive Fertigung (Wire Arc Additive Manufacturing), funktioniert ähnlich wie ein Roboter-3D-Drucker, der einen Schweißbrenner verwendet. Eine Maschine führt einen Metalldraht in einen hochtemperaturstarken Lichtbogen ein, schmilzt ihn und setzt ihn auf eine Oberfläche auf, um eine neue Form zu bilden. Der Erfolg dieses gesamten Vorgangs hängt von einem winzigen, flüchtigen Moment ab: dem Schmelzbad. Dies ist die kleine, glühende Pfütze aus flüssigem Metall, an der der Draht auf das bestehende Teil trifft. Wenn dieses Bad zu heiß, zu kalt oder sich zu schnell bewegt, wird das Endprodukt schwach oder voller Risse sein. Da dieses geschmolzene Metall unter einem blendend hellen Lichtbogen verborgen und von fliegenden Funken umgeben ist, ist es für das menschliche Auge unglaublich schwierig, es genau zu beobachten. Jahrelang haben sich Ingenieure auf Sensoren verlassen, die Elektrizität oder Schall messen, aber diese Methoden liefern nur indirekte Hinweise darauf, was tatsächlich mit dem Metall geschieht.

Eine neue Studie von Forschern verschiedener Institutionen, darunter das Indian Institute of Technology Kharagpur und die Robert Gordon University, verfolgt einen anderen Ansatz. Anstatt die Maschine zu belauschen oder ihre elektrischen Signale zu messen, beschlossen sie, einem Computer beizubringen, den Prozess direkt zu sehen. Sie entwickelten ein System, das Videos der Schweißung in Echtzeit beobachtet und versucht, zwei kritische Dinge zu identifizieren: das feste Metall, das gerade abgelegt wurde, die sogenannte Schweißraupe (Weld Bead), und das aktive, flüssige Metallbecken direkt vor dem Brenner. Die Herausforderung besteht darin, dass das Video unübersichtlich ist. Das helle Licht des Lichtbogens überstrahlt oft das Bild, und das geschmolzene Metall fließt auf eine Weise, die es schwierig macht, genau zu bestimmen, wo das Flüssige endet und das Feste beginnt. Die Forscher gingen die Aufgabe an, den besten Weg zu finden, damit ein Computer diese Merkmale erkennt, und wollten dann prüfen, ob sie diese Informationen nutzen können, um die Qualität der Schweißnaht zu beurteilen, ohne dass ein Mensch auf jedem einzelnen Videorahmen detaillierte Umrisse zeichnen muss.

Um ihre Ideen zu testen, sammelte das Team eine Sammlung industrieller Schweißvideos. Sie verwendeten keine riesige Bibliothek von Millionen von Bildern, wie es in anderen Bereichen der künstlichen Intelligenz üblich ist, sondern einen sorgfältig ausgewählten Satz von 335 Einzelbildern (Frames) aus elf echten Schweißvorgängen. Diese Frames zeigten sowohl erfolgreiche als auch fehlerhafte Schweißnähte und erfassten eine Vielzahl von Bedingungen, einschließlich Momenten, in denen der Lichtbogen instabil war oder die Metalloberfläche verunreinigt war. Die Forscher trainierten daraufhin fünf verschiedene Arten von Computer-Vision-Modellen, um als Augen für die Maschine zu fungieren. Sie testeten eine Reihe von Ansätzen, von leichtgewichtigen Modellen, die auf Standardhardware schnell laufen können, bis hin zu komplexeren Systemen, die fortgeschrittene mathematische Strukturen nutzen, die als Transformer bekannt sind. Das Ziel war es zu sehen, welches Modell am genauesten ein Rechteck um die Schweißraupe und das Schmelzbad ziehen kann, selbst wenn das Bild durch Blendung oder Bewegung verzerrt ist.

Die Ergebnisse deuteten klar auf einen spezifischen Modelltyp hin. Ein leichtgewichtiges System namens YOLOv8n erwies sich als das effektivste Werkzeug für diese Aufgabe. Es identifizierte die Schweißraupe und das Schmelzbad in der überwiegenden Mehrheit der Testbilder und erreichte eine hohe Genauigkeit bei einer Verarbeitungsgeschwindigkeit von mehr als 140 Frames pro Sekunde. Diese Geschwindigkeit ist entscheidend, da dies bedeutet, dass das System theoretisch den Schweißprozess beobachten und sofort reagieren könnte, falls etwas schiefgeht. Im Gegensatz dazu hatten die komplexeren Transformer-basierten Modelle, die in anderen Bereichen der Computer Vision vielversprechend sind, erhebliche Schwierigkeiten. Sie schnitten bei diesem kleinen, spezialisierten Datensatz wesentlich schlechter ab, was darauf hindeutet, dass diese leistungsstarken Systeme viel mehr Trainingsdaten benötigen, als hier zur Verfügung standen, um zu lernen, wie man die subtilen Details eines Lichtbogens sieht. Die Studie fand auch heraus, dass das Beibehalten der Farbe im Video, anstatt es in Schwarz-Weiß umzuwandeln, einen leichten, aber konsistenten Vorteil bot, was darauf hindeutet, dass selbst die schwachen Farbunterschiede des glühenden Metalls dem Computer helfen, die Teile zu unterscheiden.

Nachdem sie einen zuverlässigen Weg gefunden hatten, die Schweißnaht zu lokalisieren, versuchten die Forscher den nächsten Schritt: die Erstellung einer detaillierten Karte der Metallform. In vielen Aufgaben der Computer Vision kann, sobald ein Objekt gefunden wurde, ein „Foundation Model“ verwendet werden, um eine präzise Kontur darum zu zeichnen, die es Pixel für Pixel vom Hintergrund trennt. Das Team versuchte, ein hochmodernes Werkzeug namens SAM2 einzusetzen, das darauf ausgelegt ist, Objekte in Videos zu segmentieren. Sie nutzten den schnellen Detektor, um dem Werkzeug einen groben Startpunkt zu geben, und ließen das Werkzeug dann die Form der Schweißnaht verfolgen, während sie sich durch das Video bewegte. Dies funktionierte zwar gut, um den allgemeinen Bereich der Schweißnaht zu verfolgen, stieß jedoch an eine fundamentale Grenze. Das Werkzeug führte die feste Schweißraupe und das flüssige Schmelzbad immer wieder zu einer einzigen, kontinuierlichen Form zusammen. Dies geschah, weil die Schweißraupe und das Schmelzbad – im Gegensatz zu einem Auto oder einer Person – physisch miteinander verbunden sind. Das Metall fließt glatt vom flüssigen in den festen Zustand über, und das intensive Licht des Lichtbogens macht den Übergang verschwommen. Der Computer, der hauptsächlich auf Bildern von deutlich unterscheidbaren Objekten wie Tieren oder Fahrzeugen trainiert wurde, konnte diese beiden kontinuierlichen Teile nicht trennen.

Diese Einschränkung offenbarte eine wichtige Wahrheit über die Anwendung allgemeiner künstlicher Intelligenz auf spezialisierte industrielle Probleme. Während das System zuverlässig lokalisieren konnte, wo die Schweißung stattfand, und die Gesamtgröße sowie die Form der Ablagerung messen konnte, war es noch nicht in der Lage, das Flüssige perfekt vom Festen zu trennen, ohne menschliche Hilfe. Die Forscher kamen zu dem Schluss, dass es derzeit der beste Ansatz ist, den schnellen Detektor zu verwenden, um den Ort zu finden, und die Formdaten dann als Annäherung statt als exakte Messung zu behandeln. Sie planen nun, diese Näherungswerte zusammen mit den Rohvideo-Daten zu nutzen, um ein System aufzubauen, das die Qualität der gesamten Schweißsequenz beurteilen kann. Indem sie das Video als Ganzes betrachten, anstatt zu versuchen, jeden einzelnen Frame zu perfektionieren, hoffen sie, ein System zu schaffen, das einer Fabrik sagen kann, ob ein Teil gut oder schlecht ist, ohne dass ein Mensch jeden einzelnen Defekt kennzeichnen muss. Die Arbeit legt ein solides Fundament für die Zukunft und zeigt, dass einfache, schnelle Computer Vision derzeit zuverlässiger ist als komplexe, datenhungrige Systeme, wenn es darum geht, die intensive, chaotische Realität des industriellen Schweißens zu beobachten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →