← Últimos artículos
💻 computer science

DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints

Este artículo presenta DETRPose, la primera familia de modelos transformer de extremo a extremo y en tiempo real para la estimación de la pose de múltiples personas que logra una precisión de vanguardia con significativamente menos parámetros y velocidades de inferencia más rápidas mediante el aprovechamiento de un decodificador modificado, una novedosa técnica de eliminación de ruido de puntos clave y una pérdida Varifocal extendida.

Autores originales: Sebastian Janampa, Marios Pattichis

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sebastian Janampa, Marios Pattichis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás en una fiesta concurrida y necesitas tomar una foto de los movimientos de baile de todos. Tu objetivo es detectar instantáneamente a cada persona y dibujar un monigote sobre ellos, conectando correctamente todos sus puntos articulares (hombros, codos, rodillas, etc.). Esto es lo que los científicos de la computación llaman Estimación de Pose Multi-Persona.

Durante mucho tiempo, a las computadoras les costó hacer esto rápidamente. Eran o muy precisas pero lentas (como un artista meticuloso que tarda horas en dibujar a una sola persona), o rápidas pero desordenadas (como un concurso de dibujo rápido donde las extremidades se mezclan).

Este artículo presenta DETRPose, un nuevo sistema que actúa como un "fotógrafo de fiestas súper rápido y súper preciso" que utiliza un tipo especial de cerebro de IA llamado Transformer. Así es como funciona, desglosado en conceptos simples:

1. El Problema: El cuello de botella de "Buscar y Recortar"

La mayoría de los métodos rápidos solían funcionar como un portero en un club. Primero, el portero detecta a una persona, la recorta de la multitud (recorte de imagen) y luego intenta dibujar su esqueleto.

  • El defecto: Si hay 50 personas en la fiesta, el portero tiene que hacer esto 50 veces. Cuanta más gente hay, más lento es el proceso.
  • El viejo problema del Transformer: Los modelos de IA más nuevos y más inteligentes (Transformers) podían mirar a toda la multitud a la vez, pero eran demasiado lentos para ser útiles en tiempo real. Eran como un genio que necesitaba una semana para resolver un rompecabezas que un niño podría resolver en un minuto.

2. La Solución: DETRPose

Los autores construyeron DETRPose, el primer modelo Transformer que puede hacer este trabajo en tiempo real. Mira la imagen completa de una sola vez y dibuja esqueletos para todos simultáneamente.

Para hacer esto posible, introdujeron tres "trucos" principales:

Truco A: El entrenamiento de "Cancelación de Ruido" (Denoising Keypoints)

Imagina que le estás enseñando a un estudiante a encontrar un punto específico en un mapa.

  • Forma antigua: Solo le muestras el punto exacto.
  • Forma de DETRPose: Le muestras el punto exacto, pero también le muestras puntos "falsos" que están ligeramente desviados (demasiado a la izquierda, demasiado a la derecha). Le enseñas al estudiante: "Este es el real, pero los otros están cerca pero son incorrectos".
  • El resultado: Al entrenar a la IA para distinguir entre articulaciones "reales" y articulaciones falsas "con ruido", el modelo aprende mucho más rápido y se vuelve mucho más seguro de sí mismo. Esto se llama Denoising Keypoints.

Truco B: La puntuación de "Control de Calidad" (KSVF Loss)

Normalmente, los modelos de IA adivinan dónde está una articulación y dan una puntuación. Pero en la estimación de pose, una "buena suposición" no se trata solo de estar cerca; se trata de qué tan bien encaja la articulación con la forma del cuerpo de la persona.

  • Los autores crearon una nueva regla de puntuación llamada pérdida Keypoint Similarity VariFocal (KSVF).
  • Piensa en esto como un profesor estricto que no solo califica la "cercanía", sino que también verifica si la respuesta tiene sentido en el contexto de la imagen completa. Esto ayuda a la IA a ignorar las malas suposiciones y concentrarse solo en las de alta calidad, ahorrando potencia de cómputo.

Truco C: El "Decodificador Refinado" (La actualización de GroupPose)

La parte de la IA que realmente dibuja las líneas (el decodificador) fue actualizada.

  • Eliminaron pasos innecesarios que ralentizaban el proceso.
  • Añadieron una capa especial llamada Pose-LQE (Estimación de Calidad de Localización). Piensa en esto como un segundo par de ojos que revisa el dibujo antes de que la imagen final sea enviada, asegurando que los hombros y los codos se coloquen perfectamente sin ralentizar el proceso.

3. Los Resultados: Velocidad vs. Precisión

El artículo compara DETRPose con los campeones actuales (como los modelos YOLO y otros modelos pesados de Transformer).

  • El modelo "Pequeño" (DETRPose-S): Es tan preciso como los modelos YOLO más grandes y pesados, pero es mucho más pequeño (usa un 81% menos de recursos de memoria) y es mucho más rápido (la inferencia es un 52% más rápida).
  • El modelo "Grande" (DETRPose-X): En un conjunto de datos muy concurrido (CrowdPose), supera a casi todos los demás modelos Transformer utilizando 13 veces menos potencia de cómputo (FLOPs).
  • La prueba "Fuera de la Distribución": Cuando se probó en un conjunto de datos de personas en poses muy extrañas, concurridas o inusuales (OCHuman) que el modelo no había visto antes, DETRPose funcionó mejor que todos los demás. Esto demuestra que es robusto y no solo memoriza los datos de entrenamiento.

4. El único inconveniente

Los autores admiten una limitación: Aunque DETRPose es matemáticamente eficiente, sigue siendo ligeramente más lento que los modelos "YOLO" más rápidos en velocidad bruta. Esto se debe a que la forma en que agrupa a las personas requiere un intercambio de datos complejo (como reorganizar un mazo de cartas) que toma un poco de tiempo adicional. Sin embargo, es lo suficientemente rápido como para ser considerado "tiempo real" y es mucho más eficiente que los intentos anteriores de Transformer.

Resumen

DETRPose es un avance porque finalmente trae el poder "inteligente y de visión total" de la IA Transformer a la estimación de pose en tiempo real. Lo logra enseñando a la IA a aprender de sus errores más rápido (denoising), calificando sus respuestas de manera más inteligente (pérdida KSVF) y optimizando su proceso de dibujo. El resultado es un sistema que es increíblemente preciso, maneja mejor las multitudes que antes y funciona lo suficientemente rápido para aplicaciones del mundo real como la realidad virtual o el reconocimiento de actividades.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →