← Últimos artículos
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

Este artículo resume los resultados del desafío Perception Test 2025, que evaluó modelos de video multimodales de última generación en una evaluación unificada con pistas consolidadas como preguntas y respuestas sobre video unificadas y seguimiento, para destacar las dificultades significativas que enfrentan los modelos actuales al abordar diversas tareas de percepción mediante una única interfaz.

Autores originales: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

Publicado 2026-04-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un concurso de talentos gigante y de alto riesgo para la visión por computadora, pero en lugar de cantar o bailar, los concursantes son modelos de inteligencia artificial que intentan "ver" y comprender el mundo. Este artículo es el boletín de calificaciones de la edición 2025 de este concurso, llamado Perception Test, celebrado junto a una importante conferencia de ciencias de la computación.

Aquí está el desglose de lo que sucedió, utilizando analogías simples.

La Gran Idea: De Herramientas Especializadas a un Multitool Suizo

En el pasado, los modelos de IA eran como herramientas especializadas: un modelo era excelente para encontrar a una persona específica en una multitud (seguimiento), otro era genial para detectar cuándo ocurría un accidente de tráfico (detección de acciones) y un tercero era bueno para responder preguntas sobre un video.

Para el desafío de este año, los organizadores decidieron dejar de probar estas "herramientas especializadas". En su lugar, exigieron un Multitool Suizo. Querían ver si un solo modelo de IA podía hacer todo a la vez sin cambiar de sombrero. Se preguntaron: "¿Puede un solo cerebro manejar el seguimiento de una pelota, escuchar un sonido y responder una pregunta sobre la escena, todo al mismo tiempo?"

Las Cinco Pruebas Principales (Categorías)

La competencia tuvo cinco eventos principales, cada uno poniendo a prueba un "músculo" diferente de la IA:

  1. El Cuestionario Unificado de Video (La Prueba del "Ojo Mágico"):

    • La Vieja Forma: Para probar si una IA podía seguir un punto en movimiento, tenías que construir un rastreador específico.
    • La Nueva Forma: Los organizadores convirtieron estas tareas difíciles en preguntas de opción múltiple. Imagina un video donde un punto específico en una mesa parpadea en verde. Se le pregunta a la IA: "¿Cuál de estos cinco puntos fue el que parpadeó?"
    • El Giro: Añadieron preguntas engañosas como "¿En qué orden ocurrieron estas acciones?" o "¿Qué objeto estaba fingiendo hacer algo?". Esto obligó a la IA a usar el lenguaje para resolver acertijos visuales.
  2. El Desafío del Doble Seguimiento:

    • La IA tuvo que seguir dos cosas a la vez: un objeto completo (como una pelota rebotando) y un punto específico en ese objeto (como una pegatina roja en la pelota), incluso si la pelota se ocultaba detrás de una pared (oclusión).
  3. El Detective de Sonido y Acción:

    • La IA tuvo que observar un video y decir: "Exactamente a los 10 segundos, alguien pateó una pelota y se escuchó un golpe". Tuvo que encontrar el cuándo y el qué tanto para la acción visual como para el sonido simultáneamente.
  4. El Detective de "Apuntar y Hacer Clic":

    • Se le hizo a la IA una pregunta como: "¿Qué perro está persiguiendo al gato?" y tuvo que no solo decir "El marrón", sino realmente dibujar un recuadro alrededor de ese perro específico y seguirlo durante todo el video.
  5. El Corredor de Maratón (Videos de Una Hora):

    • La mayoría de los modelos de IA se cansan después de ver un clip de 30 segundos. Este evento les arrojó videos de 1 hora. La IA tuvo que recordar detalles del principio para responder una pregunta al final.

Los Resultados: Una Historia de Dos Velocidades

El artículo reporta una división fascinante en el desempeño de la IA:

  • Los Ganadores del Lenguaje: Cuando la IA pudo usar lenguaje (responder preguntas, describir escenas), obtuvo resultados mucho mejores que el año pasado. De hecho, para las pruebas de "Apuntar y Hacer Clic" y "Videos de Una Hora", las puntuaciones casi se duplicaron. Es como si la IA hubiera aprendido de repente a leer un manual y aplicarlo al mundo visual.
  • La Lucha "Silenciosa": Cuando la IA tuvo que hacer cosas sin lenguaje (como solo seguir un punto o encontrar un sonido), no mejoró mucho. Los mejores modelos "Multitool Suizo" de este año fueron en realidad más lentos que los modelos especializados de "tarea única" del año pasado.

La Conclusión: El artículo concluye que, aunque la IA está volviéndose increíble para hablar sobre lo que ve, todavía lucha por ser un cerebro único y unificado que pueda hacer todo perfectamente a la vez. El modelo de "percepción general" está en el horizonte, pero aún no está del todo ahí.

Los Ganadores

  • Total de Participaciones: Más de 100 equipos enviaron 450 intentos.
  • El Premio: Los ganadores se llevaron un total de 47.000 dólares.
  • Mejores Rendimientos: El equipo "NJUST_KMG" fue un ganador frecuente, ocupando los primeros lugares en las categorías de seguimiento, sonido y videos de una hora. Otro equipo, "SGVR@KAIST", ganó la categoría de "Apuntar y Hacer Clic".

En Resumen

La prueba Perception Test de 2025 nos mostró que la IA está aprendiendo rápidamente a hablar sobre lo que ve, pero todavía está aprendiendo a hacer todo a la vez sin confundirse. La brecha entre "robots especializados" y "percepción general similar a la humana" se está estrechando, pero la línea de meta aún está un poco lejos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →