Recovering Engineering-Change Traceability from Legacy CNC Work Orders: A Pydantic Schema and Few-Shot LLM Extraction Baseline
Dieses Paper schlägt ein Pydantic-Schema und eine Few-Shot-Baseline für ein Small Language Model vor, um die Rückverfolgbarkeit von Engineering Changes aus fragmentierten, bilingualen und gekürzten Legacy-CNC-Arbeitsaufträgen zu extrahieren, wobei eine hohe Schema-Validität nachgewiesen wird, während gleichzeitig aufgezeigt wird, dass kontextuell fundierte Pre-Prompts die Leistung verschlechtern und deterministische Post-Filter die Präzision verbessern, ohne den Recall zu beeinflussen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein Rätsel zu lösen, aber die Hinweise liegen nicht ordentlich auf Karteikarten bereit. Stattdessen sind sie in die Ränder alter, zerknitterter Quittungen gekritzelt, geschrieben in einer Mischung aus zwei Sprachen, und Teile des Papiers wurden von einem hungrigen Hund abgenagt. Dies ist die Welt des Engineering Change Management (ECM). Im Hochrisikospiel des Maschinenbaus läuft selten alles genau nach Plan. Ein Teil könnte brechen, eine Regel könnte sich ändern oder ein Material muss ausgetauscht werden. In großen, schicken Fabriken werden diese Änderungen in massiven, digitalen Datenbanken verfolgt, die wie perfekt organisierte Aktenschränke fungieren. Aber in kleineren Werkstätten lebt die „Historie“ dieser Änderungen oft in winzigen, chaotischen Notizen, die Arbeiter auf alten Computersystemen hinterlassen haben. Diese Notizen sind der „Freitext“ der Fertigungswelt: kurz, chaotisch und oft mitten im Satz abgeschnitten, weil das alte Programm, in dem sie geschrieben wurden, ein winziges Speicherlimit hatte.
Die Herausforderung für Wissenschaftler besteht darin, diese chaotischen, zweisprachigen Kritzeleien (eine Mischung aus traditionellem Chinesisch und Englisch) in eine saubere, strukturierte Liste zu verwandeln, die ein Computer tatsächlich lesen und nutzen kann. Das nennt man Informationsextraktion. Es ist, als versuche man, einem Roboter beizubringen, die chaotischen Textnachrichten eines Teenagers zu lesen und daraus einen formellen Bericht zu erstellen. Das Ziel ist es herauszufinden, was sich geändert hat, wann es sich geändert hat und wie ein Arbeitsauftrag mit einem anderen zusammenhängt, ohne dabei die Geschichte zu verlieren. Wenn wir das nicht schaffen, verlieren Unternehmen die Fähigkeit, ihre Fehler oder Verbesserungen zurückzuverfolgen, was so ist, als würde man versuchen, ein Auto zu fahren, ohne zu wissen, wohin die Straße führt.
Das Rätsel der 255-Zeichen-Grenze
In dieser Studie befassten sich Forscher aus Taiwan mit einem sehr spezifischen, sehr chaotischen Problem. Sie besuchten ein CNC-Maschinenbauunternehmen (einen Ort, an dem präzise Metallteile gefertigt werden) und untersuchten deren alte Arbeitsaufträge. Sie fanden 399 dieser Aufträge, aber nur 217 enthielten überhaupt Notizen. Die Notizen waren eine chaotische Mischung aus traditionellem Chinesisch und Englisch, voller Branchenjargon, und – hier kommt der Clou – 125 davon waren buchstäblich bei exakt 255 Zeichen abgeschnitten worden.
Warum 255? Es stellte sich heraus, dass das Unternehmen ein altes Datenbanksystem namens Microsoft Access verwendete, das die Regel hatte, dass ein Textfeld nur 255 Zeichen aufnehmen konnte. Wenn ein Arbeiter eine längere Notiz schrieb, schnitt der Computer sie einfach ab, oft mitten in einem Satz oder einem entscheidenden Detail. Es ist, als würde man versuchen, ein Rezept zu lesen, bei dem die Anweisung „Eier hinzufügen“ abgeschnitten wurde, sodass man nur noch mit „Eier hinzufügen...“ stehen bleibt und dann nichts mehr folgt.
Das Team wollte sehen, ob sie ein Small Language Model (SLM) – eine Art KI, die klug genug ist, Sprache zu verstehen, aber klein genug, um auf einem normalen Computer ohne Internetverbindung zu laufen – nutzen könnten, um dieses Chaos zu beseitigen. Sie wollten die geheimen Daten des Unternehmens nicht an einen riesigen Cloud-Server senden; sie wollten alles lokal und privat halten.
Das Werkzeug des Detektivs: Pydantic und der „Grounding“-Test
Um dies zu lösen, bauten die Forscher eine spezielle „Vorlage“, ein sogenanntes Pydantic-Schema. Stellen Sie sich dies als eine sehr strenge, digitale Ausstechform vor. Egal wie chaotisch der Teig (der Text) auch ist, die Form zwingt ihn in eine perfekte Gestalt. Die KI wurde darauf trainiert, den chaotischen Notizen zu folgen und die Informationen in diese spezifische Form zu pressen, wobei sie Dinge wie „Komponente“ (welches Teil hat sich geändert), „Substitution“ (womit es ersetzt wurde) und „Traceability Links“ (wie dieser Auftrag mit einem vorherigen verbunden ist) identifiziert.
Sie verwendeten ein Modell mit 3 Milliarden Parametern (eine „kleine“ KI in der Welt der großen Sprachmodelle) und brachten ihr bei, diese Ausstechform auszufüllen. Aber es gab einen Haken: Die KI ist ein wenig ein Tagträumer. Wenn sie eine Notiz über ein Maschinenteil sieht, wird sie manchmal so begeistert von dem, was wahr sein könnte, dass sie Details erfindet, die eigentlich gar nicht da sind. Das nennt man Halluzination. Es ist wie ein Schüler, der, wenn er gebeten wird, eine Geschichte zusammenzufassen, einen Charakter erfindet, der gar nicht im Buch vorkam, weil er denkt, dass es die Geschichte besser macht.
Die Ergebnisse: Gut im Finden, schlecht im Filtern
Die Ergebnisse waren eine Mischung aus Erfolg und einer ganz spezifischen Art des Scheiterns.
Zuer erst die guten Nachrichten: Die KI war unglaublich gut darin, den Regeln zu folgen. 96,9 % der Zeit produzierte sie eine perfekt formatierte Antwort, die in die Ausstechform passte. Sie fand die meisten Änderungen erfolgreich und konnte sogar erkennen, wenn eine Notiz abgeschnitten war.
Die KI hatte jedoch einen schweren Charakterfehler: Sie war zu großzügig.
- Für das Finden von Dingen (Recall): Hier war sie gut. Sie fand 80 % der tatsächlichen Verbindungen zwischen den Arbeitsaufträgen.
- Für die Genauigkeit (Precision): Hier war sie schrecklich. Nur 10 % der Verbindungen, die sie zu finden vorgab, waren tatsächlich real.
Auf gut Deutsch gesagt: Die KI schrie: „Ich habe eine Verbindung gefunden! Ich habe eine Verbindung gefunden!“ und sie hatte nur in einem von zehn Fällen recht. Sie schrie „Ich habe eine Verbindung gefunden!“, wenn überhaupt keine Verbindung vorhanden war – und das in neun von zehn Fällen. Sie erfand Verbindungen, um hilfreich zu sein, was in einer Fabrik, in der man genau wissen muss, was passiert ist, gefährlich ist.
Die zwei Lösungen: Eine Warnung vs. ein Filter
Die Forscher versuchten zwei verschiedene Wege, um die KI daran zu hindern, Dinge zu erfinden.
Versuch 1: Der „Nur die Fakten“-Prompt
Sie versuchten, mit der KI zu sprechen, indem sie eine spezielle Anweisung in den Prompt einfügten: „Schreibe nur Dinge auf, die du im Text sehen kannst. Wenn du dir unsicher bist, lass es leer.“
- Das Ergebnis: Dies wirkte nach hinten los. Die KI hörte nicht nur auf, Dinge zu erfinden, sondern sie schrieb auch gar nichts Nützliches mehr. Sie wurde so sehr Angst vor Fehlern, dass sie auch echte Informationen löschte. Die Zahl der korrekten Verbindungen sank von 80 % auf 40 %. Die Anweisung „Nur die Fakten“ machte die KI zu zaghaft, um ihre Arbeit zu erledigen.
Versuch 2: Der „Wahrheitsfilter“
Anstatt die KI zu bitten, vorsichtig zu sein, bauten die Forscher einen separaten, automatischen Filter, der nach der Arbeit der KI lief. Dieser Filter hatte eine einfache Regel: „Wenn die KI ein Wort oder eine Zahl geschrieben hat, prüfe, ob genau dieses Wort oder diese Zahl im Originaltext vorkommt. Wenn nicht, lösche es.“
- Das Ergebnis: Dies war eine große Verbesserung, aber kein magisches Heilmittel. Der Filter änderte nichts daran, wie viele Dinge die KI fand (der Recall blieb bei 80 %), und er löschte alle falschen Wörter, die nicht im Text standen, wodurch die Anzahl der Halluzinationen (erfundener Zeichenfolgen) auf Null sank. Dennoch stieg die Genauigkeit (Precision) der KI nur von 10 % auf 13,3 %.
Warum erreichte sie nicht 100 %? Weil die KI immer noch eine andere Art von Fehler machte. Selbst wenn die Wörter, die sie verwendete, echt und im Text vorhanden waren, ordnete sie sie manchmal der falschen Beziehung zu. Zum Beispiel sieht sie zwei Arbeitsauftragsnummern in einer Notiz und vermutet, dass sie miteinander verbunden sind, obwohl sie eigentlich nur aus einem anderen Grund nebeneinander erwähnt werden. Der Filter kann das nicht abfangen, weil die Wörter da sind; der Fehler liegt in der Logik der Verbindung, nicht in den Wörtern selbst.
Das Fazit
Die Arbeit kommt zu dem Schluss, dass man bei dieser speziellen, chaotischen Art von Daten nicht einfach eine KI anweisen kann, „ehrlich zu sein“. In dieser Größenordnung versteht die KI den Unterschied zwischen „was im Text steht“ und „was ich glaube, im Text zu sehen“ nicht wirklich. Sie benötigt einen deterministischen Filter – einen starren, gefühllosen Regelprüfer –, um ihr Chaos zu bereinigen.
Die Studie zeigt, dass wir die Historie der technischen Änderungen aus diesen alten, abgeschnittenen Notizen zwar rückgewinnen können, aber wir müssen akzeptatieren, dass die KI selbst nach der Bereinigung der Wort-Erfindungen immer noch logische Fehler begeht. Die „Grounding“-Anweisung (ihr zu sagen, sie solle vorsichtig sein) macht es schlimmer, aber ein „Post-hoc-Filter“ (ihre Arbeit im Nachhinein zu prüfen) beseitigt erfolgreich die erfundenen Wörter und verbessert die Genauigkeit, kann aber die Verwirrung der KI bezüglich der Zusammenhänge der Dinge nicht beheben. Es ist eine Erinnerung daran, dass der beste Weg, mit einem tagträumenden Roboter umzugehen, manchmal nicht darin besteht, ihn zu belehren, sondern ihm einen Faktenchecker an die Seite zu stellen, der die Lügen entlarvt, selbst wenn der Roboter die Wendungen der Handlung immer noch falsch versteht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.