← Últimos artículos
💻 computer science

Joint Enhancement of Multi-Scale Features and Adaptive Loss for YOLOv5

Este artículo propone un marco de mejora colaborativa multidimensional para YOLOv5 que integra CLAHE en el espacio LAB, una capa de detección P2 de alta resolución con Varifocal Loss, y convolución deformable con atención de canal para abordar eficazmente los desafíos de baja iluminación, objetivos pequeños y deformación geométrica en la inspección visual industrial, logrando un rendimiento superior sobre los detectores convencionales en un conjunto de datos especializado de sacos de granos.

Autores originales: Ming liang Yang, Yu yu miao, Xi jun Xu, heng Yang, qing Dong, Ke yuan Zhao

Publicado 2026-09-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ming liang Yang, Yu yu miao, Xi jun Xu, heng Yang, qing Dong, Ke yuan Zhao

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la automatización industrial, las máquinas dependen de cámaras para ver lo que los humanos ven, pero a menudo luchan con los mismos problemas visuales que nos aquejan en habitaciones mal iluminadas. Cuando el suelo de una fábrica está mal iluminado, o cuando un producto está arrugado, plegado o es diminuto, los sistemas de visión computarizada estándar pueden perder el rumbo. Podrían pasar por alto un pequeño desgarro en una bolsa o no lograr localizar una pieza dañada porque la imagen es demasiado oscura o el objeto está demasiado distorsionado. Aquí es donde entra el campo de la detección de objetos, una rama de la inteligencia artificial diseñada para enseñar a las computadoras a identificar y localizar artículos dentro de una imagen. Si bien los sistemas modernos son potentes, a menudo flaquean ante la realidad desordenada de un almacén: poca luz, defectos diminutos y objetos que no tienen una forma perfecta. Los investigadores intentan constantemente construir sistemas que puedan manejar estas condiciones difíciles sin ralentizar el rápido ritmo del trabajo industrial.

Un equipo de investigadores de la Universidad de Ciencia y Tecnología de Taiyuan y de la Compañía de Tecnología y Equipos Logísticos Taiyuan Fortucky ha abordado estos desafíos específicos mejorando un popular sistema de detección conocido como YOLOv5. Se centraron su trabajo en una tarea particularmente difícil: la inspección de sacos de tonelada (ton bags), que son grandes sacos tejidos utilizados para transportar materiales a granel. Estos sacos presentan una tormenta perfecta de dificultades para una cámara. En condiciones de poca luz, la textura tejida del saco se vuelve difícil de distinguir, y cualquier daño, como un pequeño agujero o un desgarro, suele ser demasiado pequeño para verse con claridad. Además, a medida que estos sacos se apilan y se mueven, se arrugan y se retuercen, cambiando su forma de maneras que confunden a las cámaras estándar. Los investigadores se propusieron crear una solución única que pudiera manejar la oscuridad, encontrar los defectos diminutos y adaptarse a las formas cambiantes de los sacos, todo al mismo tiempo.

Para resolver el problema de la mala iluminación, el equipo introdujo un método que actúa como una linterna inteligente para los ojos de la computadora. En lugar de simplemente iluminar toda la imagen, lo que puede deslavar los detalles o crear puntos cegadores, utilizaron una técnica que ajusta el contraste en áreas pequeñas y locales. Imagine mirar una habitación oscura donde algunas esquinas están totalmente negras y otras están ligeramente iluminadas; un iluminador simple haría que toda la habitación fuera blanca y perdería las sombras. El método utilizado aquí, conocido como CLAHE, observa pequeños parches de la imagen y aumenta el contraste solo donde es necesario. Esto permite que la computadora vea el tejido fino del saco y las sutiles diferencias que indican un desgarro, incluso en esquinas muy oscuras, manteniendo bajo control el ruido y el grano de la imagen. Este paso asegura que la computadora reciba una imagen clara y detallada antes de que siquiera comience a buscar defectos.

Una vez que la imagen es clara, el sistema necesita encontrar las áreas dañadas diminutas, que a menudo tienen solo unos pocos píxeles de ancho. Los sistemas de detección estándar suelen pasar por alto estos objetivos pequeños porque procesan las imágenes en capas que encogen gradualmente la imagen, causando que los detalles pequeños desaparezcan. Los investigadores añadieron una nueva capa al sistema que mantiene una vista de alta resolución de la imagen, permitiéndole detectar estos fallos minuciosos sin perderlos en el desenfoque. También cambiaron la forma en que el sistema aprende de sus errores. En lugar de tratar cada error de la misma manera, el nuevo método presta especial atención a los objetos pequeños difíciles de encontrar y a aquellos de los que el sistema no está seguro. Esta combinación de mantener una vista nítida y de primer plano y aprender más cuidadosamente de ejemplos difíciles mejoró significamente la capacidad del sistema para encontrar pequeños desgarros y agujeros que anteriormente habría ignorado.

El desafío final era lidiar con los sacos mientras se retuercen y se pliegan. La lente de una cámara estándar ve el mundo en una cuadrícula rígida, lo cual funciona bien para líneas rectas pero tiene dificultades cuando un objeto se dobla o se estira. Para solucionar esto, los investigadores le dieron al sistema una forma flexible de mirar la imagen. Añadieron un mecanismo que permite a la computadora desplazar ligeramente sus puntos de enfoque, adaptando su visión para coincidir con las arrugas y curvas del saco. Esto se combina con un sistema que aprende qué partes de la imagen son más importantes, diciéndole efectivamente a la computadora que ignore el ruido de fondo y se concentre en la forma del daño. Al combinar esta visión flexible con un enfoque en las características más relevantes, el sistema se volvió mucho mejor en reconocer sacos dañados incluso cuando estaban arrugados o inclinados de maneras extrañas.

Cuando los investigadores probaron su sistema mejorado en una colección de imágenes de sacos de tonelada del mundo real, los resultados fueron impactantes. En condiciones de poca luz, la capacidad del sistema para detectar daños saltó del 65.1% al 78.4%, un salto significativo que significa que se pierden muchos menos defectos. Para los objetivos más pequeños, la tasa de detección aumentó al 85.2%, y para los sacos deformados, alcanzó el 74.3%. En general, el nuevo sistema logró una precisión del 86.7%, superando a otros modelos de detección líderes como YOLOv7 y YOLOv8, que obtuvieron 75.8% y 78.6% respectivamente. El estudio demuestra que, al abordar la iluminación, la escala y la forma simultáneamente, es posible crear una herramienta de inspección robusta que funcione de manera confiable en el entorno complejo y a menudo imperfecto de un almacén industrial. Este enfoque ofrece un camino práctico hacia adelante para asegurar el control de calidad en la logística y la fabricación, donde omitir un pequeño defecto puede derivar en problemas significativos más adelante.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →