← Últimos artículos
💻 computer science

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1 es un marco de aprendizaje por refuerzo que mitiga el olvido visual de contexto largo en modelos de lenguaje multimodales grandes mediante la aplicación de supervisión a nivel de proceso para fomentar el uso sostenido de evidencia visual a lo largo de trayectorias de razonamiento complejas.

Autores originales: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

Publicado 2026-08-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot superinteligente a resolver un misterio mirando una única imagen compleja. Le dices al robot: "Mira esta imagen y dime qué está pasando". Al principio, el robot es un detective en alerta máxima, mirando intensamente cada detalle de la foto. Pero a medida que el robot empieza a hablar, escribiendo sus largos pensamientos paso a paso, algo extraño sucede. Cuanto más habla, más parece olvidar la imagen por completo. Empieza a confiar en sus propias palabras previas, adivinando lo que podría haber en la imagen basándose en cómo suelen ser las historias, en lugar de lo que realmente hay allí. Este es un problema para una nueva generación de "Modelos de Lenguaje de Gran Escala Multimodales" (MLLM por sus siglas en inglés): sistemas de IA que pueden ver y leer. Se están volviendo mejores en el razonamiento complejo, pero tienen un fallo: a medida que su "cadena de pensamiento" se vuelve más larga, sufren de "olvido visual". Se alejan de la evidencia visual, lo que conduce a respuestas erróneas incluso cuando la imagen contiene la verdad.

Aquí entra Remember-R1, un nuevo y astuto método de entrenamiento diseñado para mantener los ojos del robot pegados a la imagen, sin importar cuán larga sea la historia. Piensa en el proceso de razonamiento de la IA como un largo viaje por carretera. En el pasado, los investigadores intentaron solucionar el problema del olvido volviendo a mostrarle el mapa al conductor constantemente (reintroduciendo la imagen), lo cual era lento y torpe. Otros intentaron pedirle al conductor que hiciera una lista de las cosas que creía haber visto y que revisara esa lista más tarde, pero eso era como revisar una nota de un tercero en lugar de mirar la carretera real. Remember-R1 toma un enfoque diferente. En lugar de cambiar el viaje o añadir paradas, actúa como un entrenador estricto pero útil que viaja en el asiento trasero, susurrando recompensas al conductor mientras este conduce.

El artículo propone un sistema llamado Remember-R1 que utiliza una técnica de Aprendizaje por Refuerzo para entrenar a estos modelos. La idea central es supervisar directamente el "proceso de pensamiento" del modelo, en lugar de solo calificar la respuesta final. Los investigadores diseñaron tres "recompensas" específicas para fomentar que el modelo se mantenga anclado en la imagen:

  1. La recompensa del "Cazador de Palabras Clave": El modelo recibe puntos por mencionar explícitamente detalles específicos y anotados que encontró en la imagen (como "esfera azul" o "cubo diminuto") a lo largo de su razonamiento. Es como un juego donde el conductor recibe un bono por detectar y nombrar cada hito específico por el que pasa, asegurando que no esté inventando cosas.
  2. La recompensa del "Guardián de la Memoria": Esta recompensa castiga al modelo si empieza a prestar menos atención a la imagen a medida que la conversación se alarga. El objetivo es mantener la "atención visual" constante desde el primer paso hasta el último, evitando que el modelo se pierda en un ensueño donde depende únicamente de su propio texto.
  3. La recompensa del "Foco de Luz": Esto asegura que el modelo no esté mirando la imagen de forma aleatoria; debe centrar su atención en las partes específicas de la imagen que realmente responden a la pregunta. Si la pregunta es sobre un coche rojo, el modelo es recompensado por mantener su "foco de luz" en el coche rojo, no en los árboles del fondo.

Los autores probaron Remember-R1 en dos tamaños diferentes de modelos de IA (3 mil millones y 7 mil millones de parámetros) a través de siete bancos de pruebas distintos, incluyendo matemáticas, lógica y comprensión visual general. Los resultados sugieren que este método funciona. Los modelos entrenados con Remember-R1 desempeñaron consistentemente mejor que sus contrapartes no entrenadas y otros métodos existentes. Por ejemplo, en el benchmark MathVista, el modelo de 3B mejoró su puntuación de 51.90 a 65.50, y el de 7B saltó de 62.30 a 69.80.

Crucialmente, el artículo muestra que esta mejora no se trata solo de obtener la respuesta correcta al final, sino de cómo se llega a ella. Al analizar la "atención" de los modelos, los investigadores descubrieron que Remember-R1 ralentiza la tasa a la que el modelo olvida la imagen. Mientras que los modelos estándar tienden a perder interés en la imagen a mitad de su razonamiento, los modelos de Remember-R1 mantienen su mirada fija en la evidencia visual mucho más tiempo. El artículo descarta explícitamente la idea de que simplemente volver a mostrar la imagen al modelo durante el proceso sea la mejor solución, señalando que es demasiado costoso y rompe el flujo del razonamiento. En su lugar, argumentan que entrenar al modelo para mantener su propio enfoque visual a través de estas recompensas específicas es el camino más efectivo.

En resumen, Remember-R1 sugiere que, al recompensar a los modelos de IA por ser buenos "detectives visuales" durante todo su proceso de pensamiento —detectando palabras clave, manteniendo su memoria fresca y enfocándose en los puntos correctos— podemos evitar que olviden lo que están viendo. Esto no solo los hace más inteligentes en matemáticas o lógica; los convierte en observadores más fiables del mundo, asegurando que sus historias largas y complejas estén siempre arraigadas en la verdad de la imagen que están viendo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →