← Últimos artículos
💻 computer science

Image Thresholding: Understanding Bias of Evaluation Metrics towards Specific Evaluation Functions

Este artículo revela un sesgo inherente en la evaluación de la segmentación de imágenes, demostrando que la función objetivo de la varianza interclase de Otsu se correlaciona consistentemente de manera más fuerte con métricas de calidad estándar como SSIM y PSNR que con la entropía de Kapur, desafiando así la suposición de neutralidad métrica.

Autores originales: Eslam Hegazy, Mohamed Gabr

Publicado 2026-05-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Eslam Hegazy, Mohamed Gabr

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando cortar un pastel en rebanadas perfectas. En el mundo de la visión por computadora, este "pastel" es una imagen, y "cortarlo" significa separar diferentes partes de la imagen (como el cielo del suelo, o un tumor del tejido sano). Este proceso se llama umbralización de imágenes.

Para hacer esto, las computadoras necesitan un reglamento, o una Función Objetivo, que les indique dónde cortar. Dos de los reglamentos más famosos son:

  1. Método de Otsu: Este reglamento dice: "Corta el pastel donde la diferencia entre las partes claras y oscuras sea la mayor". Es como intentar maximizar el contraste entre el glaseado y la esponja.
  2. Método de Kapur: Este reglamento dice: "Corta el pastel donde el contenido de información esté más equilibrado". Es una regla más compleja basada en la cantidad de "sorpresa" o variedad que hay en cada rebanada.

Una vez que la computadora hace un corte, necesitamos verificar si lo hizo bien. Para ello, utilizamos Métricas de Evaluación, que son como jueces calificando el corte. Los dos jueces más populares en este campo son:

  • SSIM (Índice de Similitud Estructural): Un juez que observa qué tan similares son las formas y estructuras de la imagen cortada con respecto a la original.
  • PSNR (Relación Pico Señal-Ruido): Un juez que mide cuánta "estática" o error se introdujo durante el corte.

El Gran Problema: El Juez está Sesgado

Los autores de este artículo, Eslam Hegazy y Mohamed Gabr, notaron algo sospechoso. En casi todos los estudios que comparan estos métodos, el Método de Otsu parece ganar cuando se califica con SSIM y PSNR. Los investigadores asumieron que esto significaba que Otsu era simplemente un reglamento mejor.

Pero los autores se hicieron una pregunta diferente: "¿Y si los jueces (SSIM y PSNR) están secretamente sesgados hacia el reglamento de Otsu?"

Piénsalo como un concurso de cocina.

  • Otsu es un chef que se especializa en preparar platos de alto contraste (muy salados, muy dulces).
  • Kapur es un chef que prepara platos equilibrados y complejos.
  • SSIM y PSNR son los jueces.

Los autores sospecharon que SSIM y PSNR son en realidad jueces "sesgados por el sabor". Están programados para amar los platos de alto contraste. Así que, incluso si Kapur prepara un plato perfectamente equilibrado, los jueces podrían darle una calificación más baja simplemente porque no sabe como lo que ellos prefieren.

Cómo lo Probaron

Para demostrarlo, no utilizaron una IA sofisticada para encontrar el mejor corte. En su lugar, hicieron algo muy exhaustivo: probaron cada corte posible en 500 imágenes naturales diferentes (de un conjunto de datos llamado BSDS500).

Para cada corte individual, calcularon:

  1. Qué tan bueno era el corte según el reglamento de Otsu.
  2. Qué tan bueno era el corte según el reglamento de Kapur.
  3. Cómo calificaron los jueces (SSIM y PSNR) ese corte.

Luego, examinaron la relación (correlación) entre los reglamentos y los jueces.

Los Resultados: El Sesgo es Real

Los hallazgos fueron claros y sorprendentes:

  1. Otsu y los Jueces son Mejores Amigos: Cuando el reglamento de Otsu decía que un corte era "bueno", los jueces (SSIM y PSNR) casi siempre estaban de acuerdo. De hecho, para el 100% de las imágenes, las puntuaciones de Otsu se movieron en perfecta sincronía con las puntuaciones de PSNR. Para el 91% de las imágenes, se movieron en sincronía con SSIM.

    • Analogía: Es como si Otsu y los jueces hablaran el mismo idioma. Cuando Otsu levanta la mano, los jueces levantan la suya inmediatamente.
  2. Kapur y los Jueces son Extraños: El reglamento de Kapur tenía una conexión mucho más débil con los jueces. A veces estaban de acuerdo, a veces no. La relación era desordenada e impredecible.

    • Analogía: Kapur está intentando hablar un dialecto diferente. Los jueces lo entienden a veces, pero a menudo simplemente encogen los hombros y le dan una calificación mediocre, incluso si el corte era realmente bueno.

Qué Significa Esto

El artículo concluye que la razón por la que los métodos basados en Otsu a menudo "ganan" en los artículos de investigación no es necesariamente porque sean mejores cortando el pastel. Es porque el sistema de puntuación (SSIM y PSNR) está amañado para favorecer a Otsu.

Si un investigador inventa un nuevo algoritmo de IA súper inteligente para ayudar a Kapur a encontrar los mejores cortes, pero aún utiliza SSIM y PSNR para calificarlo, el nuevo algoritmo podría parecer un fracaso. ¿Por qué? Porque los jueces están sesgados contra el estilo de Kapur, independientemente de lo buena que sea la IA.

La Conclusión

Los autores están advirtiendo a la comunidad científica: No confíen ciegamente en los jueces.

Si quieres comparar de manera justa diferentes formas de cortar imágenes, no puedes usar solo SSIM y PSNR. Debes darte cuenta de que estas herramientas prefieren inherentemente un método específico (Otsu) sobre otros. Para obtener una imagen real de quién es el mejor "chef", podrías necesitar nuevos jueces que no tengan un sabor favorito.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →