← Últimos artículos
📊 statistics

Agreement Between Fitzpatrick-17k Skin-Type Labels Is Metric- and Stratum-Dependent: A Chance-Corrected Reanalysis

Este artículo reanaliza el conjunto de datos Fitzpatrick-17k utilizando estadísticas corregidas por azar para demostrar que el acuerdo de etiquetas entre las fuentes de anotación depende altamente de la métrica elegida y del estrato del tipo de piel, revelando discrepancias significativas —particularmente para los tonos de piel más oscuros— que requieren la notificación transparente de la metodología y de los intervalos de confianza por estrato en la investigación de IA dermatológica.

Autores originales: Niya Pennie

Publicado 2026-08-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Niya Pennie

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a reconocer diferentes tonos de la piel humana, como un estudiante de arte digital aprendiendo a pintar retratos. Para hacer esto, el robot necesita un "maestro" que observe fotos y diga: "Esto es muy pálido", o "Esto es marrón profundo". En el mundo de la dermatología y la inteligencia artificial, este maestro es a menudo un anotador humano que asigna un tipo de piel basándose en la escala de Fitzpatrick, un sistema que clasifica la piel en seis categorías, desde el Tipo I (muy clara, siempre se quema) hasta el Tipo VI (profundamente pigmentada, rara vez se quema). Pero aquí está la parte complicada: los humanos no son perfectos. Una persona puede pensar que una foto es "marrón medio", mientras que otra dice "marrón oscuro". Si el robot aprende de estas instrucciones confusas, podría confundirse, especialmente cuando intenta ayudar a personas con tonos de piel más oscuros que ya están subrepresentadas en la atención médica. La gran pregunta es: ¿Qué tanto coinciden realmente estos maestros humanos entre sí, y importa si discrepan por solo un paso en la escala?

Este artículo es como una historia de detectives donde una investigadora, Niya Pennie, regresa a un famoso conjunto de datos llamado Fitzpatrick-17k para revisar la tarea. Este conjunto de datos fue creado pidiendo a dos grupos diferentes de trabajadores de plataformas de crowdsourcing (uno de Scale AI y otro de Centaur Labs) que etiquetaran miles de fotos de piel. Los creadores originales del conjunto de datos dijeron: "¡Oigan, el 85% de las veces, nuestros dos grupos estuvieron bastante cerca, usualmente dentro de un paso el uno del otro!". Eso sonaba muy bien. Pero Pennie decidió realizar una prueba más estricta y matemática para ver qué estaba pasando realmente. Ella no solo preguntó: "¿Estuvieron cerca?". Ella preguntó: "¿Eligieron exactamente el mismo número? Y si estaban desviados por un paso, ¿eso cuenta como una victoria o una pérdida?".

Esto es lo que la investigación descubrió. Primero, la historia de "cerca pero no exacto" es cierta: si cuentas el estar desviado por solo un tipo de piel como "acuerdo", entonces sí, los dos grupos estuvieron de acuerdo el 91% de las veces. Pero si exiges que elijan el mismo número exacto, el acuerdo cae a menos de la mitad (47.9%). Es como dos amigos mirando un atardecer y uno diciendo "naranja" y el otro diciendo "naranja rojizo". Están cerca, pero no están diciendo lo mismo.

El artículo también descubrió que este desacuerdo no se distribuye de manera uniforme. Es como un juego donde las reglas cambian dependiendo de la puntuación. Para los tipos de piel más claros (Tipo I), los dos grupos estuvieron de acuerdo casi el 88% de las veces. Pero para los tipos de piel más oscuros (Tipos II al VI), el acuerdo se desplomó, manteniéndose entre el 34% y el 55%. En otras palabras, los maestros humanos estaban mucho más confundidos sobre la piel oscura que sobre la clara. Además, los dos grupos no solo discreparon de forma aleatoria; tenían un patrón. El grupo de Centaur Labs tendía a etiquetar las fotos como más claras de lo que lo hacía el grupo de Scale AI, especialmente para los tonos de piel más oscuros.

Finalmente, el artículo señala un serio "problema de conteo". Para la categoría de piel más oscura (Tipo VI), hay muy pocas fotos de condiciones cutáneas graves (imágenes malignas) en el conjunto de datos. Bajo un sistema de etiquetado, había 61 de estas imágenes; bajo el otro, solo 45. Debido a que estos números son tan pequeños, el artículo sugiere que cualquier estudio que intente medir qué tan bien funciona una IA en este grupo específico sería como intentar adivinar la altura promedio de una habitación midiendo solo a tres personas. Los resultados serían demasiado inestables e imprecisos para ser confiables.

Así que, la conclusión principal no es que el conjunto de datos sea inútil, sino que debemos ser mucho más cuidadosos sobre cómo lo leemos. El artículo argumenta que los investigadores no pueden simplemente decir "la IA es justa" sin especificar exactamente qué sistema de etiquetado usaron, cómo definieron el "acuerdo" y si tienen suficientes datos para hacer una afirmación sólida. Si cambias las reglas del juego (la fuente de etiquetado) o el tamaño del equipo (el número de imágenes), la puntuación cambia. El artículo concluye que para entender verdaderamente si la IA es justa para todos, necesitamos dejar de tratar estas etiquetas como hechos perfectos y empezar a reportar exactamente qué tan inciertos y variables son realmente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →