← Últimos artículos
💻 computer science

The Evolution of Object Detection: A Systematic Review of Transformer-Based and Few-Shot Learning Approaches

Esta revisión sistemática de la literatura analiza el cambio de paradigma en la detección de objetos desde las arquitecturas convolucionales tradicionales hacia los modelos basados en Transformers y de aprendizaje de pocos disparos (few-shot learning), destacando sus beneficios al simplificar los procesos de detección y mejorar la eficiencia de los datos, al tiempo que aborda desafíos persistentes como el costo computacional y la detección de objetos pequeños mediante innovaciones arquitectónicas y estrategias de preentrenamiento avanzadas.

Autores originales: MD.Shakiful Islam Khan, Gorkem Kar

Publicado 2026-09-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: MD.Shakiful Islam Khan, Gorkem Kar

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Durante décadas, la forma en que las computadoras aprendían a ver el mundo dependía de un proceso rígido y paso a paso. Para encontrar un coche en una fotografía, un programa primero escaneaba la imagen en busca de formas específicas, luego adivinaba dónde podrían estar los objetos y, finalmente, utilizaba un conjunto de reglas manuales para decidir qué conjeturas eran reales y cuáles eran duplicados. Este método funcionaba bien, pero era como construir una casa con mil herramientas diferentes, cada una de las cuales requería que un humano ajustara la configuración antes de que pudiera comenzar el siguiente paso. Era complejo, lento para adaptarse a nuevos entornos y le costaba comprender la visión de conjunto de una escena. Recientemente, surgió un nuevo enfoque que cambió esto por completo. En lugar de utilizar estos pasos separados y diseñados a mano, los investigadores comenzaron a utilizar un sistema inspirado en cómo los humanos leen las oraciones: mirando la imagen completa a la vez y comprendiendo cómo cada parte se relaciona con todas las demás. Este cambio permitió que las computadoras aprendieran directamente de los datos sin necesidad de que un humano escribiera las reglas para cada objeto posible. Sin embargo, este nuevo método tenía sus propios problemas: era increíblemente lento para aprender, requería cantidades masivas de potencia informática y a menudo pasaba por alto detalles pequeños. Al mismo tiempo, surgió un desafío diferente en el campo de la inteligencia artificial. La mayoría de estos sistemas inteligentes necesitaban millones de ejemplos etiquetados para aprender algo nuevo, lo cual es imposible en situaciones como la imagenología médica o el rastreo de fauna silvestre poco común, donde los datos son escasos. Los científicos comenzaron a preguntarse cómo hacer que estos poderosos sistemas de visión aprendieran con solo unos pocos ejemplos, o incluso sin ninguno.

Un equipo de investigadores de la Universidad de Central Missouri se propuso mapear el viaje de la convergencia de estos dos grandes desarrollos. Realizaron una revisión sistemática, un método riguroso de recopilación y análisis de los artículos científicos más importantes publicados entre 2020 y 2025. Su objetivo era comprender cómo los nuevos sistemas de visión de "imagen completa", conocidos como Transformers, se estaban combinando con técnicas que permiten el aprendizaje con muy pocos datos. Examinaron treinta y cinco estudios de alta calidad para ver qué impulsaba este cambio, qué nuevos diseños se crearon para solucionar las fallas iniciales y qué problemas siguen sin resolverse. Los investigadores descubrieron que la razón principal para abandonar los antiguos métodos paso a paso era eliminar la necesidad de atajos diseñados por humanos. Los nuevos sistemas tratan la detección de un objeto como una tarea única y directa, lo que los hace mucho más flexibles y fáciles de entrenar para nuevas situaciones. Sin embargo, este cambio no estuvo exento de costos. Las versiones iniciales de estos nuevos sistemas fueron notoriamente lentas para aprender y tuvieron dificultades para detectar objetos pequeños porque intentaban mirar cada parte de una imagen con la misma intensidad, lo que es computacionalmente costoso.

Para resolver estos problemas de velocidad y precisión, los investigadores observaron que los científicos desarrollaron rápidamente formas más inteligentes para que la computadora enfocara su atención. En lugar de mirar toda la imagen por igual, los diseños más recientes aprendieron a seleccionar solo los puntos más importantes, de forma muy similar a como una persona escanea una multitud para encontrar a un amigo en lugar de mirar fijamente a toda la habitación. Esto permitió que los sistemas procesaran imágenes más rápido y detectaran objetos más pequeños de manera más confiable. Más allá de simplemente hacer que los sistemas fueran más rápidos, la revisión destacó un cambio masivo en la forma en que los investigadores manejan el problema de la falta de datos. En el pasado, los científicos intentaban construir algoritmos especiales y personalizados para enseñar a una computadora con solo unas pocas imágenes. La revisión encontró que este enfoque está siendo reemplazado por una estrategia que se apoya en modelos masivos preentrenados. Estos son sistemas que ya han aprendido a comprender el mundo estudiando miles de millones de imágenes y descripciones de texto de internet. En lugar de enseñar a una computadora desde cero, los investigadores ahora toman estos modelos potentes y preexistentes y simplemente los guían hacia una nueva tarea con unos pocos ejemplos o una descripción de texto sencilla. Este método ha demostrado ser mucho más efectivo que construir soluciones personalizadas desde los cimientos.

A pesar de estos éxitos, la revisión identificó varios obstáculos persistentes que el campo aún no ha superado. Un problema importante es que estos modelos potentes, aunque excelentes para reconocer objetos comunes como gatos o coches, a menudo tienen dificultades cuando se les pide identificar elementos en entornos completamente diferentes, como escaneos médicos o fotos satelitales. Los sistemas tienden a confundirse cuando el estilo visual cambia, un problema conocido como desplazamiento de dominio (domain shift). Otro desafío es que, a medida que estos modelos aprenden cosas nuevas, a veces olvidan lo que ya sabían, un fenómeno llamado olvido catastrófico. Los investigadores señalaron que, si bien están surgiendo soluciones, como técnicas para ayudar al modelo a recordar la información antigua mientras aprende nuevas categorías, estas siguen siendo áreas de desarrollo activo. La revisión también señaló que el entrenamiento de estos sistemas masivos requiere enormes cantidades de potencia de cómputo, lo que plantea dudas sobre la eficiencia y el impacto ambiental. Los autores sugieren que el futuro de este campo no reside en construir modelos más grandes, sino en hacerlos más inteligentes y eficientes, y en crear mejores formas de probarlos en diferentes escenarios del mundo real.

El estudio concluye que el campo de la detección de objetos ha experimentado una transformación fundamental. La era de los procesos complejos de múltiples pasos ha dado paso a un enfoque unificado y de extremo a extremo (end-to-end) que es tanto más poderoso como más adaptable. La integración del aprendizaje eficiente en datos con estas nuevas arquitecturas marca un salto significativo, alejando a la industria de la necesidad de conjuntos de datos masivos y etiquetados hacia un futuro donde las computadoras pueden aprender del mundo tal como es, con toda su variedad y escasez. Los investigadores enfatizan que, si bien las barreras técnicas iniciales se han superado en gran medida, el enfoque ahora se desplaza hacia hacer que estos sistemas sean lo suficientemente robustos para el mundo real, donde cambian las luces, los objetos se esconden y los datos rara vez son perfectos. El camino a seguir consiste en refinar estos modelos para que sean más eficientes, asegurar que no olviden lo que han aprendido y desarrollar mejores estándares para medir sus verdaderas capacidades a través de los diversos desafíos del mundo físico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →