ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection
El artículo propone ADOPD, un marco de destilación on-policy con privilegios de referencia que internaliza los beneficios de la comparación basada en referencias en un modelo estudiante de solo consulta mediante el aprovechamiento de un profesor consciente de la referencia para guiar la detección de anomalías de grano fino, logrando un rendimiento zero-shot de vanguardia en el benchmark MMAD.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective intentando resolver un misterio, pero en lugar de una escena del crimen, estás observando el suelo de una fábrica. Tu trabajo es detectar la más mínima raya en un dispositivo nuevo y brillante que no debería estar ahí. Este es el mundo de la Detección de Anomalías Industriales. Durante mucho tiempo, las computadoras han sido pésimas en esto porque solo saben qué es lo "normal" en un sentido general, no los detalles específicos de cada producto que sale de la línea de producción.
Entran en escena los Modelos de Lenguaje de Gran Escala Multimodales (MLLM). Piensa en ellos como detectives de IA superinteligentes que pueden ver imágenes y leer texto al mismo tiempo. Son excelentes razonando, pero a menudo pasan por alto los detalles diminutos y específicos necesarios para detectar un defecto. Por lo general, para ayudar a estos detectives de IA, los humanos les dan una "foto de referencia": una foto de un artículo perfecto y sin defectos para compararlo con el sospechoso. Es como mostrarle a un detective la foto de una huella dactilar perfecta para que pueda detectar la mancha en la real. Sin embargo, hacer esto para cada artículo es lento y computacionalmente costoso, como pedirle a un detective que vaya a la biblioteca a buscar un libro de referencia cada vez que mira una pista. La gran pregunta que se hicieron los investigadores fue: ¿Podemos enseñar a la IA a recordar cómo luce esa referencia perfecta, para que no necesite buscarla cada vez?
Aquí es donde surge un nuevo estudio, que propone un ingenioso método de entrenamiento llamado ADOPD. Los investigadores querían ver si podían "internalizar" los beneficios de comparar imágenes directamente en el cerebro de la IA durante el entrenamiento. No querían que la IA simplemente memorizara respuestas; querían que aprendiera cómo inspeccionar cosas.
El equipo configuró un escenario de entrenamiento con dos personajes: un Maestro y un Estudiante. El Maestro es una IA superinteligente que tiene la oportunidad de ver tanto el artículo sospechoso como la foto de referencia perfecta. El Estudiante es la IA que realmente queremos usar después, y solo llega a ver el artículo sospechoso. El objetivo es lograr que el Estudiante actúe con la misma inteligencia que el Maestro, incluso sin la foto de referencia.
Pero aquí está la parte difícil. El Maestro podría ser demasiado inteligente. Podría adivinar la respuesta correcta solo por el texto que está leyendo o por la "vibra" general de la imagen, ignorando la comparación específica que se suponía que debía realizar. Para solucionar esto, los investigadores inventaron un juego de "encuentra las diferencias" para el Maestro. Le mostraron al Maestro la suposición del mismo estudiante dos veces: una con la foto de referencia correcta (la vista "Emparejada") y otra con una foto de referencia incorrecta (la vista "Desemparejada").
Si al Maestro realmente le importa la referencia, su confianza debería dispararse cuando ve la foto correcta y caer cuando ve la foto incorrecta. Los investigadores usaron esta diferencia para crear una "puntuación de confianza" especial. Si el Maestro tiene confianza solo debido a la foto incorrecta, el Estudiante aprende a ignorar esa pista. Si el Maestro tiene confianza debido a la foto correcta, el Estudiante aprende a prestar mucha atención. Este proceso se llama Destilación On-Policy Privilegiada de Referencia. Es como un entrenador observando a un jugador practicar, pero el entrenador solo da retroalimentación cuando el jugador está usando realmente la técnica correcta, no cuando solo está adivinando.
Los resultados sugieren que este método funciona sorprendentemente bien. Al ser probado en un benchmark llamado MMAD, que incluye siete tipos diferentes de tareas de inspección industrial, el nuevo método alcanzó una precisión promedio del 77.31%. Este es un salto significativo, mejorando el modelo base en 6.14 puntos. Lo que es aún más impresionante, esta IA, que nunca vio una foto de referencia durante la prueba, se desempeñó mejor que el mismo modelo cuando sí se le permitía ver una foto de referencia (un entorno de "one-shot"), superándolo en precisión por 2.64 puntos. Sin embargo, el estudio señala un compromiso: aunque el nuevo método encontró más defectos (mayor sensibilidad o recall), fue ligeramente más propenso a falsas alarmas, lo que resultó en una pequeña caída en la precisión (precision) en comparación con el entorno de "one-shot".
El estudio sugiere que, mediante el uso de este truco de entrenamiento de "Emparejado vs. Desemparejado", la IA aprendió una estrategia de grano fino para detectar defectos. No solo memorizó hechos; aprendió a buscar las diferencias visuales específicas que importan. Los investigadores encontraron que este enfoque fue particularmente bueno para determinar dónde estaba un defecto y qué tipo de anomalía era, en lugar de simplemente adivinar la categoría. Aunque el método actualmente requiere imágenes emparejadas y anotaciones específicas para entrenar, los hallazgos indican que podemos enseñar a la IA a ser una inspectora más aguda y autosuficiente, capaz de detectar las fallas más diminutas sin necesidad de una referencia cada vez.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.