← Últimos artículos
💻 computer science

TAPNext++: What's Next for Tracking Any Point (TAP)?

El artículo presenta TAPNext++, una mejora del modelo TAPNext que utiliza arquitecturas de transformadores recurrentes entrenadas con secuencias largas y aumentos geométricos específicos para superar las limitaciones en videos extensos y la re-detección de puntos, estableciendo un nuevo estado del arte en el seguimiento de puntos en cualquier video.

Autores originales: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

Publicado 2026-04-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que estás en una fiesta muy animada y tienes que seguir con la mirada a un amigo específico (tu "punto") entre la multitud. A veces se esconde detrás de alguien, a veces sale de la habitación por un momento y luego vuelve, o a veces la cámara (tu ojo) se mueve mucho.

El problema es que la mayoría de los "detectives" de video actuales (los modelos de IA) son como personas con una memoria muy corta: si tu amigo se esconde un poco, los olvidan. Si sale de la habitación y vuelve, no saben que es él. Y si la fiesta dura mucho tiempo (un video largo), se cansan y pierden el rastro.

Aquí es donde entra TAPNext++, el nuevo superhéroe del seguimiento de puntos. Vamos a desglosar qué hace este papel tan importante de forma sencilla:

1. El Problema: La memoria de un pez dorado

Los modelos anteriores (como el "TAPNext" original) eran rápidos y eficientes, como un corredor de maratón muy ágil. Pero tenían un defecto: su "memoria a largo plazo" era mala.

  • La analogía: Imagina que intentas recordar una dirección mientras conduces. Si conduces 5 minutos, la recuerdas bien. Pero si conduces 2 horas sin parar, empiezas a dudar y a confundirte. Los modelos viejos se confundían después de unos segundos de video. Además, si tu amigo salía de la habitación y volvía, el modelo pensaba: "¿Quién es ese? No lo conozco".

2. La Solución: Entrenando para la maratón (Videos largos)

Los autores se dieron cuenta de que el problema no era el "motor" del coche (la arquitectura del modelo), sino que no lo habían entrenado para carreras largas.

  • Lo que hicieron: En lugar de entrenar al modelo con videos cortos de 48 cuadros (como si fueran trozos de pan), lo entrenaron con videos de 1024 cuadros (como si fuera una baguette gigante).
  • El truco mágico: Para hacer esto posible sin que el ordenador se quemara, usaron una técnica llamada "paralelismo de secuencia".
    • Analogía: Imagina que tienes que leer un libro de 1000 páginas. Si lo lees tú solo, tardas mucho. Pero si divides el libro entre 8 amigos, cada uno lee una parte y luego se pasan las notas al final para unir la historia. Así, el modelo aprende a recordar cosas durante mucho tiempo sin perder el hilo.

3. El Entrenamiento Especial: "El efecto túnel"

El mayor problema era cuando los puntos (tu amigo) desaparecían y volvían a aparecer. Los modelos viejos fallaban aquí.

  • La solución creativa: Crearon un entrenamiento especial con "aumentos geométricos".
    • La analogía del "Rodillo" (Roll): Imagina que el video es una cinta de correr. A veces, el video se mueve de lado a lado o gira. Si tu amigo sale por la puerta de la derecha, el modelo está entrenado para saber que podría aparecer por la izquierda, como en un videojuego de Pac-Man. Esto obliga al modelo a no depender solo de "dónde estaba hace un segundo", sino a reconocer cómo se ve su amigo (su apariencia), incluso si ha cambiado de lugar drásticamente.
  • Aprendiendo a esperar: También les enseñaron a no rendirse cuando el amigo está oculto. Les dijeron: "Aunque no lo veas, sigue adivinando dónde podría estar". Esto ayuda a que, cuando el amigo vuelva a aparecer, el modelo ya tenga una idea de dónde buscar.

4. La Nueva Regla del Juego: La prueba de "¿Quién eres?"

Los autores se dieron cuenta de que nadie medía realmente qué tan bien funcionaban estos modelos cuando alguien volvía a aparecer.

  • La nueva métrica (AJRD): Inventaron un nuevo examen. Imagina que tu amigo desaparece 100 segundos y luego vuelve. El examen no mide si lo seguiste bien antes de que desapareciera, sino qué tan rápido y bien lo reconoces cuando vuelve.
  • El resultado: TAPNext++ aprobó este examen con notas excelentes, mientras que los modelos anteriores fallaban estrepitosamente.

5. ¿Por qué es tan genial? (Velocidad y Precisión)

Lo mejor de todo es que, aunque ahora es más inteligente y tiene mejor memoria, sigue siendo rapidísimo.

  • Analogía: Es como un Ferrari que ha aprendido a leer mapas complejos y a recordar rutas de 1000 kilómetros, pero que sigue corriendo a 300 km/h.
  • Puede procesar videos en tiempo real (más de 60 veces por segundo) en una sola tarjeta gráfica, lo que significa que podría usarse en gafas de realidad aumentada o en robots que necesitan reaccionar al instante.

En resumen

TAPNext++ es como darle a un detective de video una memoria de elefante y entrenarlo en un gimnasio de situaciones caóticas (personas que entran y salen, cámaras que giran).

  • Antes: "Te perdí de vista, no sé quién eres".
  • Ahora: "Te vi salir por la puerta, sé que volverás por la otra, y aquí estás. ¡Te tengo!"

Esto es un gran paso para la realidad aumentada, los robots y cualquier tecnología que necesite entender el mundo en movimiento sin perder el rastro de las cosas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →