← Últimos artículos
🤖 AI

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE es un marco de memoria agéntica multimodal que mejora la comprensión de videos de larga duración mediante la construcción de memorias centradas en entidades y autocorrectivas a través de la vinculación transmodal, el refinamiento bidireccional y la verificación cruzada de múltiples agentes para prevenir la confusión de identidad y las alucinaciones, logrando una mejora de precisión del 5.9% sobre los modelos base del estado del arte.

Autores originales: Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

Publicado 2026-08-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio que abarca una película entera, pero solo se te permite mirar un fotograma congelado a la vez, y cada pocos minutos, tu memoria se borra por completo. Este es el lucha diaria de la inteligencia artificial moderna cuando intenta comprender videos largos. Los modelos de IA más inteligentes de hoy son como detectives brillantes que pueden leer una sola página de un libro perfectamente, pero si les entregas una película de 40 minutos, se sienten abrumados. Intentan comprimir toda la historia en una pequeña caja mental, o la trocean en piezas diminutas y aisladas. ¿El problema? Cuando troceas una historia, pierdes las conexiones. Olvidas quiénes son los personajes, confundes sus nombres y empiezas a suponer salvajemente lo que pasó en la primera escena porque no puedes recordar las pistas de la última escena.

Aquí es donde entra el campo de la "comprensión de video de larga duración". Los científicos están tratando de enseñar a las computadoras a ver horas de video, recordar los detalles y responder preguntas complicadas sobre qué sucedió, quién lo hizo y por qué. El objetivo es construir una IA que no solo vea píxeles, sino que comprenda una historia, realizando un seguimiento de personas y objetos desde la escena inicial hasta los créditos. Pero los métodos actuales suelen fallar porque son demasiado agresivos al resumir el video, descartando los pequeños detalles necesarios para distinguir a una persona de otra, o se quedan atrapados en un bucle donde no pueden corregir un error cometido hace cinco minutos porque solo están mirando el "ahora".

Presentamos ViSAGE, un nuevo sistema diseñado por investigadores de la Universidad de Zhejiang y la Universidad de Xidian que actúa como una memoria superpotente y autocorrectiva para agentes de IA. Piensa en la memoria de una IA estándar como un cuaderno desordenado donde tomas notas mientras ves una película, pero una vez que pasas la página, no puedes volver atrás para corregir un error. Si piensas que un personaje es "Mario" en la primera escena, pero más tarde descubres que en realidad es "Emma", un sistema normal lo seguirá llamando Mario para siempre, lo que conduce a respuestas confusas y erróneas. ViSAGE, sin embargo, es como un detective que mantiene una lista maestra de sospechosos y una línea de tiempo de eventos. Cuando llega una nueva pista —como escuchar un nombre mencionado en una conversación en el minuto 30—, no solo la archiva; vuelve atrás y reescribe las notas del principio para asegurarse de que toda la historia tenga sentido.

Los investigadores descubrieron que, al construir este sistema "autocorrectivo", la IA finalmente podía manejar la confusión de los videos largos. Crearon un marco que separa el "qué pasó" (los eventos) del "quién lo hizo" (los personajes). Cuando la IA ve a una persona pero aún no sabe su nombre, le asigna una etiqueta temporal. Más tarde, cuando el video revela su nombre, ViSAGE utiliza una "actualización hacia atrás" para corregir instantáneamente todas las notas anteriores, asegurando que cada acción esté correctamente vinculada a la persona adecuada. También utiliza un equipo de "agentes" para verificar su trabajo. Si la IA no está segura de una respuesta, en lugar de inventar una historia (lo que se llama alucinación), está programada para decir: "No lo sé", lo cual es mucho más seguro y confiable.

En sus pruebas, este nuevo enfoque funcionó significativamente mejor que los métodos anteriores más destacados. En un conjunto de pruebas de video largo desafiantes, ViSAGE mejoró la precisión en un 5.9% en comparación con el sistema existente más fuerte. Específicamente, obtuvo un 45.5% en tareas de video relacionadas con robots, un 58.4% en tareas de video basadas en la web y un masivo 79.1% en el benchmark Video-MME-long. Los investigadores demostraron que, al corregir los errores de memoria, la IA no solo respondió más preguntas correctamente, sino que también dejó de cometer errores peligrosos, como confundir quién estaba haciendo qué, y se volvió mucho mejor al admitir cuando carecía de información. Esto sugiere que, para que la IA comprenda verdaderamente las historias largas, necesita una memoria que pueda crecer, cambiar y corregirse a sí misma, en lugar de ser una simple lista estática de hechos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →