Recovering Engineering-Change Traceability from Legacy CNC Work Orders: A Pydantic Schema and Few-Shot LLM Extraction Baseline
Cet article propose un schéma Pydantic et une base de référence de petit modèle de langage en quelques exemples (few-shot) pour extraire la traçabilité des changements d'ingénierie à partir d'ordres de travail CNC hérités, fragmentés, bilingues et tronqués, démontrant une validité de schéma élevée tout en révélant que les pré-prompts contextuellement ancrés dégradent la performance et que les filtres post-déterministes améliorent la précision sans affecter le rappel.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un détective tentant de résoudre un mystère, mais que les indices ne soient pas proprement inscrits sur des fiches cartonnées. Au lieu de cela, ils sont griffonnés dans les marges de vieux reçus froissés, écrits dans un mélange de deux langues, et une partie du papier a été mâchouillée par un chien affamé. C'est le monde de la Gestion des Changements d'Ingénierie (ECM). Dans le jeu à enjeux élevés de la construction de machines, les choses ne se passent que rarement exactement comme prévu. Une pièce peut se casser, une règle peut changer, ou un matériau peut devoir être remplacé. Dans les grandes usines sophistiquées, ces changements sont suivis dans de gigantesques bases de données numériques qui agissent comme des classeurs parfaitement organisés. Mais dans les plus petits ateliers, l'« historique » de ces changements vit souvent dans de petites notes désordonnées laissées par les travailleurs sur de vieux systèmes informatiques. Ces notes sont le « texte libre » du monde de la fabrication : courtes, chaotiques et souvent coupées au milieu d'une phrase parce que l'ancien logiciel dans lequel elles ont été écrites avait une capacité de mémoire minuscule.
Le défi pour les scientifiques est de transformer ces gribouillages désordonnés et bilingues (un mélange de chinois traditionnel et d'anglais) en une liste propre et structurée qu'un ordinateur peut réellement lire et utiliser. C'est ce qu'on appelle l'Extraction d'Informations. C'est comme essayer d'apprendre à un robot à lire les messages textuels chaotiques d'un adolescent et à les transformer en un rapport formel. L'objectif est de découvrir ce qui a changé, quand cela a changé, et comment un ordre de travail est lié à un autre, le tout sans perdre le fil de l'histoire en cours de route. Si nous ne pouvons pas le faire, les entreprises perdent la capacité de retracer leurs erreurs ou leurs améliorations, ce qui revient à essayer de conduire une voiture sans savoir où se trouve la route.
Le Mystère de la Limite des 255 Caractères
Dans cette étude, des chercheurs de Taïwan ont abordé un problème très spécifique et très désordonné. Ils se sont rendus dans une entreprise de machines CNC (un lieu qui fabrique des pièces métalliques de précision) et ont examiné leurs anciens ordres de travail. Ils en ont trouvé 399, mais seulement 217 contenaient des notes. Les notes étaient un mélange chaotique de chinois traditionnel et d'anglais, truffé de jargon industriel, et — voici le hic — 125 d'entre elles étaient littéralement tronquées à exactement 255 caractères.
Pourquoi 255 ? Il s'avère que l'entreprise utilisait un ancien système de base de données appelé Microsoft Access, qui imposait une règle selon laquelle une zone de texte ne pouvait contenir que 255 caractères. Si un travailleur écrivait une note plus longue, l'ordinateur la coupait simplement, souvent en plein milieu d'une phrase ou d'un détail crucial. C'est comme essayer de lire une recette où les instructions pour « ajouter les œufs » sont coupées, ne laissant que « ajouter les... » et puis rien.
L'équipe voulait voir si elle pouvait utiliser un Petit Modèle de Langage (SLM) — un type d'IA suffisamment intelligent pour comprendre le langage, mais assez petit pour fonctionner sur un ordinateur ordinaire sans avoir besoin d'Internet — pour réparer ce désordre. Ils ne voulaient pas envoyer les données secrètes de l'entreprise vers un énorme serveur dans le cloud ; ils voulaient les garder en local et en toute confidentialité.
La Boîte à Outils du Détective : Pydantic et le Test de « Mise en Vérité » (Grounding)
Pour résoudre cela, les chercheurs ont construit un « modèle » spécial appelé schéma Pydantic. Considérez cela comme un moule à biscuits numérique très strict. Peu importe la pâte désordonnée (le texte), le moule la force à prendre une forme parfaite. L'IA a été entraînée à regarder les notes désordonnées et à forcer l'information dans cette forme spécifique, identifiant des éléments tels que le « Composant » (quelle pièce a changé), la « Substitution » (ce pour quoi elle a été remplacée) et les « Liens de Traçabilité » (comment ce travail se connecte à un précédent).
Ils ont utilisé un modèle de 3 milliards de paramètres (une IA « petite » dans le monde des grands modèles de langage) et lui ont appris à remplir ce moule à biscuits. Mais il y avait un piège : l'IA est un peu rêveuse. Lorsqu'elle voit une note concernant une pièce de machine, elle s'excite parfois tellement sur ce qui pourrait être vrai qu'elle invente des détails qui n'existent pas réellement. C'est ce qu'on appelle l'hallucination. C'est comme un élève qui, lorsqu'on lui demande de résumer une histoire, invente un personnage qui n'était pas dans le livre parce qu'il pense que cela rend l'histoire meilleure.
Les Résultats : Bon pour Trouver, Mauvais pour Filtrer
Les résultats étaient un mélange de succès et d'un type d'échec très spécifique.
D'abord, la bonne nouvelle : l'IA était incroyablement douée pour suivre les règles. 96,9 % du temps, elle produisait une réponse parfaitement formatée qui correspondait au moule à biscuits. Elle parvenait à trouver la plupart des changements et pouvait même repérer quand une note était coupée.
Cependant, l'IA avait un défaut de personnalité majeur : elle était trop généreuse.
- Pour trouver des choses (Rappel/Recall) : Elle était excellente. Elle a trouvé 80 % des connexions réelles entre les ordres de travail.
- Pour être précise (Précision) : Elle était terrible. Seulement 10 % des connexions qu'elle prétendait avoir trouvées étaient réellement authentiques.
En langage clair : l'IA criait : « J'ai trouvé un lien ! J'ai trouvé un lien ! » et elle n'avait raison qu'une fois sur dix. Elle criait « J'ai trouvé un lien ! » alors qu'il n'y avait aucun lien neuf fois sur dix. Elle inventait des connexions pour être utile, ce qui est dangereux dans une usine où l'on doit savoir exactement ce qui s'est passé.
Les Deux Solutions : Un Avertissement vs Un Filtre
Les chercheurs ont essayé deux méthodes différentes pour empêcher l'IA d'inventer des choses.
Tentative 1 : Le Prompt « Juste les Faits »
Ils ont essayé de parler à l'IA, en ajoutant une instruction spéciale au prompt : « N'écrivez que les choses que vous pouvez voir dans le texte. Si vous n'êtes pas sûr, laissez vide. »
- Le Résultat : Cela a eu l'effet inverse. L'IA n'a pas seulement arrêté d'inventer des choses ; elle a aussi cessé d'écrire quoi que ce soit d'utile. Elle est devenue si effrayée par l'idée de commettre une erreur qu'elle a supprimé des informations réelles également. Le nombre de liens corrects est passé de 80 % à 40 %. L'instruction « Juste les Faits » a rendu l'IA trop timide pour faire son travail.
Tentative 2 : Le « Filtre de Vérité »
Au lieu de demander à l'IA d'être prudente, les chercheurs ont construit un filtre automatique distinct qui s'exécutait après que l'IA eut terminé son travail. Ce filtre avait une règle simple : « Si l'IA a écrit un mot ou un nombre, vérifiez si ce mot ou ce nombre exact apparaît dans le texte d'origine. S'il n'y est pas, supprimez-le. »
- Le Résultat : Ce fut une amélioration considérable, mais pas un remède miracle. Le filtre n'a pas changé le nombre de choses que l'IA trouvait (le Rappel est resté à 80 %), et il a éliminé tous les mots faux qui n'étaient pas dans le texte, faisant tomber le compte des hallucinations de mots inventés à zéro. Cependant, la précision de l'IA n'est passée que de 10 % à 13,3 %.
Pourquoi n'a-t-elle pas atteint 100 % ? Parce que l'IA commettait un autre type d'erreur. Même lorsque les mots utilisés étaient réels et présents dans le texte, elle les attachait parfois à la mauvaise relation. Par exemple, elle peut voir deux numéros d'ordre de travail dans une note et supposer qu'ils sont connectés, alors qu'ils sont simplement mentionnés côte à côte pour une autre raison. Le filtre ne peut pas attraper cela car les mots sont là ; l'erreur réside dans la logique de la connexion, et non dans les mots eux-mêmes.
La Conclusion
L'article conclut que pour ce type de données spécifiques et désordonnées, on ne peut pas simplement dire à une IA d'« être honnête ». À cette taille, l'IA ne comprend pas vraiment la différence entre « ce qui est dans le texte » et « ce que je pense être dans le texte ». Elle a besoin d'un filtre déterministe — un vérificateur de règles rigide et insensible — pour nettoyer son désordre.
L'étude montre que nous pouvons récupérer l'historique des changements d'ingénierie à partir de ces vieilles notes tronquées, mais nous devons accepter que l'IA commettra toujours des erreurs logiques même après avoir corrigé les inventions de mots. L'instruction de « mise en vérité » (lui dire d'être prudente) aggrave la situation, mais un « filtre post-hoc » (vérifier son travail après coup) parvient à supprimer tous les mots inventés et améliore la précision, bien qu'il ne puisse pas corriger la confusion de l'IA concernant les relations entre les éléments. C'est un rappel que parfois, la meilleure façon de gérer un robot rêveur n'est pas de le sermonner, mais de lui donner un vérificateur de faits capable de repérer les mensonges, même si le robot se trompe encore sur l'intrigue.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.