Recovering Engineering-Change Traceability from Legacy CNC Work Orders: A Pydantic Schema and Few-Shot LLM Extraction Baseline
Este artículo propone un esquema de Pydantic y un modelo de lenguaje pequeño de pocos disparos (few-shot) como línea base para extraer la trazabilidad de cambios de ingeniería a partir de órdenes de trabajo de CNC heredadas, fragmentadas, bilingües y truncadas, demostrando una alta validez de esquema al tiempo que revela que los pre-prompts contextualizados degradan el rendimiento y que los filtros deterministas posteriores mejoran la precisión sin afectar la exhaustividad.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective intentando resolver un misterio, pero las pistas no están escritas ordenadamente en tarjetas de índice, sino que están garabateadas en los márgenes de recibos viejos y arrugados, escritas en una mezcla de dos idiomas, y parte del papel ha sido mordido por un perro hambriento. Este es el mundo de la Gestión de Cambios de Ingeniería (ECM). En el juego de alto riesgo de construir máquinas, las cosas rara vez salen exactamente según lo planeado. Una pieza puede romperse, una regla puede cambiar o un material puede necesitar ser sustituido. En las grandes y sofisticadas fábricas, estos cambios se rastrean en bases de datos digitales masivas que actúan como archivadores perfectos y organizados. Pero en talleres más pequeños, la "historia" de estos cambios suele vivir en pequeñas y desordenadas notas dejadas por los trabajadores en sistemas informáticos antiguos. Estas notas son el "texto libre" del mundo de la fabricación: cortas, caóticas y a menudo interrumpidas a mitad de una frase porque el viejo software en el que fueron escritas tenía un límite de memoria diminuto.
El desafío para los científicos es convertir estos garabatos desordenados y bilingües (una mezcla de chino tradicional e inglés) en una lista limpia y estructurada que una computadora pueda realmente leer y usar. Esto se llama Extracción de Información. Es como intentar enseñarle a un robot a leer los mensajes de texto caóticos de un adolescente y convertirlos en un informe formal. El objetivo es descubrir qué cambió, cuándo cambió y cómo se conecta una orden de trabajo con otra, todo sin perder la historia en el proceso. Si no podemos hacer esto, las empresas pierden la capacidad de rastrear sus errores o mejoras, lo cual es como intentar conducir un coche sin saber hacia dónde va la carretera.
El Misterio del Límite de 255 Caracteres
En este estudio, investigadores de Taiwán abordaron un problema muy específico y muy desordenado. Fueron a una empresa de maquinaria CNC (un lugar donde se construyen piezas de metal precisas) y examinaron sus antiguas órdenes de trabajo. Encontraron 399 de estas órdenes, pero solo 217 tenían alguna nota. Las notas eran una mezcla caótica de chino tradicional e inglés, llenas de jerga industrial y —aquí está el detalle— 125 de ellas estaban literalmente cortadas exactamente a los 255 caracteres.
¿Por qué 255? Resulta que la empresa utilizaba un sistema de base de datos antiguo llamado Microsoft Access, que tenía la regla de que un cuadro de texto solo podía contener 255 letras. Si un trabajador escribía una nota más larga, la computadora simplemente la cortaba, a menudo justo en medio de una oración o de un detalle crucial. Es como intentar leer una receta donde las instrucciones para "añadir los huevos" se cortan, dejándote solo con "añadir los..." y luego nada.
El equipo quería ver si podían usar un Modelo de Lenguaje Pequeño (SLM) —un tipo de IA que es lo suficientemente inteligente como para entender el lenguaje pero lo suficientemente pequeña como para ejecutarse en una computadora normal sin necesidad de internet— para arreglar este desastre. No querían enviar los datos secretos de la empresa a un gigante servidor en la nube; querían mantenerlo local y privado.
La Caja de Herramientas del Detective: Pydantic y la Prueba de "Anclaje"
Para resolver esto, los investigadores construyeron una "plantilla" especial llamada esquema Pydantic. Piensa en esto como un cortador de galletas digital muy estricto. No importa cuán desordenada sea la masa (el texto), el cortador la obliga a tomar una forma perfecta. La IA fue entrenada para mirar las notas desordenadas y forzar la información en esta forma específica, identificando elementos como "Componente" (qué pieza cambió), "Sustitución" (por qué fue cambiada) y "Enlaces de Trazabilidad" (cómo se conecta este trabajo con uno anterior).
Utilizaron un modelo de 3 mil millones de parámetros (una IA "pequeña" en el mundo de los grandes modelos de lenguaje) y le enseñaron a rellenar este cortador de galletas. Pero había un inconveniente: la IA es un poco soñadora. Cuando ve una nota sobre una pieza de una máquina, a veces se emociona tanto con lo que podría ser verdad que inventa detalles que en realidad no están ahí. Esto se llama alucinación. Es como un estudiante que, al pedirle que resuma una historia, inventa un personaje que no estaba en el libro porque piensa que eso hace que la historia sea mejor.
Los Resultados: Buena para Encontrar, Mala para Filtrar
Los resultados fueron una mezcla de éxito y un tipo de fallo muy específico.
Primero, la buena noticia: la IA fue increíblemente buena siguiendo las reglas. El 96. 9% de las veces, produjo una respuesta perfectamente formateada que encajaba en el cortador de galletas. Logró encontrar la mayoría de los cambios e incluso pudo detectar cuándo una nota estaba cortada.
Sin embargo, la IA tenía un defecto de personalidad importante: era demasiado generosa.
- Para encontrar cosas (Recall/Recuperación): Fue excelente. Encontró el 80% de las conexiones reales entre las órdenes de trabajo.
- Para ser precisa (Precision/Precisión): Fue terrible. Solo el 10% de las conexiones que afirmaba haber encontrado eran reales.
En lenguaje sencillo: la IA estaba gritando: "¡Encontré un enlace! ¡Encontré un enlace!", y solo tenía razón 1 vez de cada 10. Estaba gritando "¡Encontré un enlace!" cuando no había ningún enlace en 9 de cada 10 ocasiones. Estaba inventando conexiones para ser útil, lo cual es peligroso en una fábrica donde necesitas saber exactamente qué sucedió.
Los Dos Arreglos: Una Advertencia vs. Un Filtro
Los investigadores probaron dos formas diferentes de evitar que la IA inventara cosas.
Intento 1: El Prompt de "Solo los Hechos"
Intentaron hablarle a la IA, añadiendo una instrucción especial al prompt: "Solo escribe las cosas que puedes ver en el texto. Si no estás seguro, déjalo en blanco".
- El Resultado: Esto salió mal. La IA no solo dejó de inventar cosas; dejó de escribir cualquier cosa útil. Se volvió tan temerosa de cometer un error que también eliminó información real. El número de enlaces correctos cayó del 80% al 40%. La instrucción de "Solo los Hechos" hizo que la IA fuera demasiado tímida para hacer su trabajo.
Intento 2: El "Filtro de Verdad"
En lugar de pedirle a la IA que tuviera cuidado, los investigadores construyeron un filtro automático separado que se ejecutaba después de que la IA terminara su trabajo. Este filtro tenía una regla simple: "Si la IA escribió una palabra o un número, verifica si esa palabra o número exactos aparecen en el texto original. Si no es así, elimínalo".
- El Resultado: Esto fue una gran mejora, pero no una cura mágica. El filtro no cambió cuántas cosas encontraba la IA (el Recall se mantuvo en el 80%), y eliminó todas las palabras falsas que no estaban en el texto, llevando el conteo de alucinaciones de palabras inventadas a cero. Sin embargo, la precisión de la IA (Precision) solo subió del 10% al 13.3%.
¿Por qué no llegó al 100%? Porque la IA seguía cometiendo un tipo diferente de error. Incluso cuando las palabras que usaba eran reales y estaban presentes en el texto, a veces las vinculaba a la relación incorrecta. Por ejemplo, podría ver dos números de orden de trabajo en una nota y suponer que están conectados, cuando en realidad solo se mencionan uno al lado del otro por una razón distinta. El filtro no puede detectar esto porque las palabras están ahí; el error reside en la lógica de la conexión, no en las palabras mismas.
La Conclusión
El artículo concluye que para este tipo específico y desordenado de datos, no puedes simplemente decirle a una IA que "sea honesta". A este tamaño, la IA no entiende realmente la diferencia entre "lo que está en el texto" y "lo que yo creo que está en el texto". Necesita un filtro determinista —un verificador de reglas rígido e insensible— para limpiar su desorden.
El estudio demuestra que podemos recuperar la historia de los cambios de ingeniería de estas notas viejas y fragmentadas, pero tenemos que aceptar que la IA seguirá cometiendo errores lógicos incluso después de que arreglemos las fabricaciones de palabras. La instrucción de "anclaje" (decirle que tenga cuidado) empeora las cosas, pero un "filtro post-hoc" (revisar su trabajo después) logra eliminar todas las palabras inventadas y mejora la precisión, aunque no puede corregir la confusión de la IA sobre cómo se relacionan las cosas. Es un recordatorio de que, a veces, la mejor manera de lidar con un robot soñador no es darle un sermón, sino darle un verificador de hechos que pueda detectar las mentiras, incluso si el robot todavía se equivoca en los giros de la trama.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.