← Últimos artículos
💻 computer science

Doomed to Re-Annotate, Forever: The ImageNet Story

Este artículo presenta ReImageNet, una versión de la de validación de ImageNet-1k exhaustivamente reanotada que corrige aproximadamente el 12% de las etiquetas originales e incorpora etiquetas múltiples, localización y atributos semánticos, lo que resulta en ganancias significativas de precisión tanto para modelos supervisados como para MLLMs, al tiempo que demuestra que la anotación a gran escala requiere una colaboración iterativa entre humanos y LLM.

Autores originales: Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

Publicado 2026-08-17
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a ver el mundo, como un niño que aprende a reconocer animales en un zoológico. Para hacer esto, necesitas un libro de imágenes masivo donde cada foto esté etiquetada con el nombre correcto de lo que hay dentro. En el mundo de la visión por computadora, este "libro de imágenes" se llama ImageNet. Durante más de una década, ha sido el estándar de oro, la prueba definitiva para ver si los ojos de un robot se están volviendo más agudos. La prueba es simple: mostrarle al robot una imagen y preguntarle: "¿Qué es lo principal en esta foto?". Si el robot acierta la palabra correcta, gana un punto. Esta puntuación, llamada "precisión Top-1", ha sido el marcador para cada gran avance en la inteligencia artificial.

Sin embargo, hay un inconveniente. Imagina si tu libro de imágenes hubiera sido escrito por una multitud apresurada de personas que no sabían mucho sobre animales y a quienes se les pagaba por hora. Podrían haber pasado por alto un segundo animal escondido en los arbustos, llamar perro real a un perro de juguete, o etiquetar el reflejo de un espejo como el objeto real. Con el tiempo, estos pequeños errores se acumulan. Si el libro de pruebas es desordenado, realmente no puedes saber si el robot es inteligente o si simplemente tuvo suerte adivinando las respuestas desordenadas. Este artículo profundiza en ese libro de imágenes desordenado para ver qué tan desordenado es realmente y si podemos limpiarlo sin romper el marcador.


La Gran Limpieza de ImageNet: Una Historia de Etiquetas Desordenadas y Robots Inteligentes

Piensa en el conjunto de datos ImageNet-1k como un álbum de fotos gigante de 50,000 páginas que todo el mundo de la IA ha estado usando para entrenar sus ojos. Durante años, los investigadores han tratado este álbum como un texto sagrado, asumiendo que cada etiqueta era perfecta. Pero los autores de este artículo, un equipo de la Universidad Técnica Checa de Praga, decidieron pasarle una lupa a todo el conjunto. Se hicieron una pregunta simple y aterradora: ¿Qué pasa si las respuestas en nuestro libro de pruebas son incorrectas?

No se limitaron a echar un vistazo a unas pocas páginas; re-etiquetaron todo el conjunto de validación desde cero. Esto significa que volvieron a mirar cada una de las 50,000 imágenes, pero esta vez con un enfoque mucho más inteligente y cuidadoso. Se dieron cuenta de que la forma antigua de etiquetar —donde un humano tenía que elegir solo una palabra para una imagen— era como intentar describir una fiesta caótica nombrando solo a la persona que está más cerca de la puerta. Podrías perderte al DJ, el pastel o el gato sobre la mesa.

La Gran Revelación: El Álbum Era un Desastre
Cuando terminaron su trabajo, descubrieron que las etiquetas originales estaban lejos de ser perfectas.

  • La Tasa de "Respuesta Incorrecta": Alrededor del 12% de las imágenes tenían la etiqueta incorrecta por completo. Es como una foto de un gato siendo etiquetada como un perro.
  • La Tasa de "Elementos Faltantes": Un impresionante 33.3% de las imágenes contenían en realidad múltiples cosas importantes, pero las etiquetas antiguas solo elegían una. Si una foto tenía un perro, una pelota y una cerca, la etiqueta antigua podría simplemente decir "perro", ignorando el resto.
  • La Tasa de "Sin Coincidencia": Sorprendentemente, el 3.8% de las imágenes ni siquiera contenía nada de las 1,000 categorías con las que se suponía debían probarse. Estas eran simplemente láminas en blanco o cosas que no encajaban con las reglas.

Para solucionar esto, el equipo creó ReImageNet. En lugar de obligar a los humanos a elegir un único ganador, permitieron anotaciones multietiqueta. Permitieron que los anotadores dijeran: "Está bien, hay un perro, una pelota y una cerca". También añadieron "atributos" especiales para manejar situaciones complicas:

  • Reflejo: Si ves un rostro en un espejo, ¿es un rostro? Sí, pero es un reflejo.
  • Representación: ¿Es esa una pistola real o una pistola de juguete? La etiqueta necesita saber la diferencia.
  • Multitud: Si hay cincuenta personas en una foto, ¿las contamos a todas? Crearon una etiqueta especial para grupos para que los anotadores no tuvieran que dibujar cincuenta cajitas diminutas.

El Equipo "Humano + Robot"
Una de las partes más interesantes de su historia es cómo lo hicieron. No se limitaron a contratar a una multitud de extraños en internet (un método llamado crowdsourcing) y esperar lo mejor. Descubrieron que el crowdsourcing a menudo conduce a la confusión porque las reglas son demasiado difíciles de explicar en un manual corto.

En su lugar, construyeron un "equipo de ensueño". Contrataron a un pequeño grupo de expertos capacitados y les dieron un superpoder: asistentes de IA. Utilizaron modelos de IA potentes (como GPT-4o y otros) para mirar las fotos primero y sugerir qué había en ellas. Luego, los expertos humanos revisarían esas sugerencias. Fue una colaboración: la IA era el explorador rápido e incansable, y el humano era el editor cuidadoso. El artículo encontró que esta combinación era la mejor manera de obtener etiquetas de alta calidad. La IA por sí sola no era perfecta, y los humanos por sí solos eran demasiado lentos, pero juntos, alcanzaron un nuevo nivel de precisión.

¿Qué Pasó Cuando Probaron a los Robots?
Una vez que tuvieron las nuevas etiquetas limpias, pasaron los modelos de IA antiguos por la prueba nuevamente. Los resultados fueron una mezcla de "ups" y "guau".

  • La Vieja Guardia (Modelos Supervisados): Los modelos de IA tradicionales, que fueron entrenados con las etiquetas desordenadas antiguas, no mejoraron mucho. Sus puntuaciones aumentaron solo entre un 0.05% y un 1.2%. Parece que ya habían aprendido a adivinar las respuestas desordenadas bastante bien.
  • Los Nuevos Integrantes (MLLM): Los modelos más nuevos y avanzados (Modelos de Lenguaje de Gran Escala Multimodales) experimentaron un salto enorme. Sus puntuaciones aumentaron entre un 5% y un 6%. Esto sugiere que estos modelos más inteligentes estaban realmente confundidos por las etiquetas viejas y desordenadas. Cuando las etiquetas se limpiaron, finalmente pudieron mostrar qué tan inteligentes eran en realidad.

La Sorpresa del "Zoom-In"
El equipo también hizo algo ingenioso: recortaron los objetos específicos de las fotos (como recortar una imagen de solo el perro) y probaron a los robots con esas piezas diminutas. Descubrieron que los robots de estilo antiguo se volvían terribles reconociendo cosas cuando el fondo desaparecía. Su precisión caía hasta un 33%. Esto significa que esos robots dependían del fondo (como saber que un perro suele estar sobre el césped) en lugar de reconocer realmente al perro. Los modelos más nuevos y inteligentes eran mucho mejores en esto, demostrando que realmente "veían" el objeto.

El Efecto Dominó
El artículo también nos advierte que este desorden no está solo en ImageNet. Debido a que tantos otros tests fueron construidos usando ImageNet como plano, los errores se han extendido como un virus. Los autores estiman que estas pruebas derivadas tienen de 1.7 a 5.8 veces más errores que la original. Es como si hubieras construido una casa nueva usando un plano que tenía las medidas incorrectas; la nueva casa sería igual de torcida.

La Conclusión
Los autores concluyen que no podemos simplemente construir una prueba perfecta de un solo golpe. No es un trabajo de una sola vez; es un proceso. Tienes que seguir revisando, seguir refinando y seguir utilizando las mejores herramientas disponibles. Argumentan que los días de la etiquetación de "un solo paso" han terminado. Para construir el futuro de la IA, necesitamos una asociación entre humanos cuidadosos y una IA poderosa, que se revisen mutuamente el trabajo constantemente.

En resumen, el artículo nos dice que durante mucho tiempo, hemos estado calificando a la IA en un examen que estaba lleno de erratas. Ahora que hemos corregido las erratas, vemos que algunas IA son en realidad mucho más inteligentes de lo que pensábamos, mientras que otras solo eran buenas adivinando las respuestas incorrectas. Y la lección para todos es: no confíes en un libro de pruebas solo porque es viejo; a veces, tienes que reescribirlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →