← Últimos artículos
🤖 AI

CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

CoEvo-Mem es un marco de bucle cerrado que optimiza simultáneamente las políticas de recuperación y la evolución del banco de memoria mediante actualizaciones alternas y retroalimentación condicionada por la trayectoria, logrando un rendimiento de vanguardia en diversos bancos de pruebas al abordar la interdependencia fundamental entre el acceso y el refinamiento de la memoria en agentes de LLM a largo plazo.

Autores originales: Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

Publicado 2026-08-04
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot brillante pero olvidadizo a jugar un videojuego complejo. El robot tiene un cerebro masivo (un Modelo de Lenguaje Extenso) que sabe hablar y pensar, pero solo puede retener una cantidad minúscula de información en su "memoria de trabajo" a la vez; es como intentar resolver un rompecabezas viendo solo las últimas tres piezas. Para jugar bien a largo plazo, el robot necesita una biblioteca de experiencias pasadas para consultar. Aquí es donde entra en juego la Generación Aumentada por Recuperación (RAG): es como si el robot le preguntara al bibliotecario: "Oye, ¿hemos visto un rompecabezas como este antes?".

Pero aquí está la parte difícil: el robot necesita dos cosas para funcionar perfectamente. Primero, necesita un Bibliotecario (la política de recuperación) que sea realmente bueno encontrando las notas correctas para la pregunta actual. Segundo, necesita un Tomador de Notas (el banco de memoria) que sea bueno organizando esas notas, decidiendo cuáles son realmente útiles y actualizándolas a medida que el juego se vuelve más difícil. Durante mucho tiempo, los científicos intentaron hacer al Bibliotecario más inteligente manteniendo al Tomador de Notas estático, o hicieron al Tomador de Notas mejor manteniendo al Bibliotecario igual. Pero, ¿qué pasaría si el Bibliotecario necesita saber cómo están organizadas las notas para encontrarlas, y el Tomador de Notas necesita saber qué está buscando el Bibliotecario para organizarlas mejor? Necesitan aprender juntos, en un bucle.

Esto es exactamente lo que explora el artículo CoEvo-Mem. Los autores proponen un sistema donde el "Bibliotecario" y el "Tomador de Notas" evolucionan juntos, enseñándose constantemente el uno al otro cómo hacer mejor su trabajo. Probaron esta idea en siete tipos diferentes de tareas desafiantes, que van desde escribir código de computadora hasta resolver preguntas científicas o controlar el sistema operativo de una computadora. Los resultados sugieren que cuando estas dos partes aprenden en sincronía, el robot se vuelve significativamente mejor para resolver problemas largos y complejos que cuando aprenden por separado.

El Problema: El Bucle de Retroalimentación Roto

Imagina que estás estudiando para un examen de historia enorme. Tienes una pila de tarjetas de estudio (tu memoria) y una guía de estudio (tu política de recuperación). Si tu guía de estudio es mala, podrías elegir las tarjetas equivocadas para repasar. Pero si tus tarjetas están desordenadas y desorganizadas, incluso una buena guía de estudio podría tener dificultades para encontrar la correcta.

En el mundo de los agentes de IA, los métodos existentes suelen arreglar un lado del problema ignorando el otro. Algunos métodos intentan hacer que la IA sea mejor pidiendo memorias (recuperación), mientras que otros intentan que la IA sea mejor almacenando y organizando memorias (evolución). Los autores de este artículo argumentan que esta separación es un error. Señalan un "bucle de retroalimentación fundamental" que estaba siendo ignorado:

  1. La recuperación decide qué se usa: Si la IA elige las memorias incorrectas, esas memorias no reciben ningún "crédito" por ayudar (o perjudicar) la tarea.
  2. Las actualizaciones de memoria cambian el futuro: Si la IA actualiza sus memorias basándose en lo que sucedió, la forma en que esas memorias se organizan cambia, lo que hace que sea más difícil o fácil encontrarlas la próxima vez.

Si solo arreglas el método de recuperación sin dejar que la memoria cambie, o viceversa, pierdes la oportunidad de que ambos mejoren juntos. Es como intentar afinar una guitarra mientras las cuerdas están cambiando constantemente de grosor; no puedes obtener un sonido perfecto a menos que ajustes ambos al mismo tiempo.

La Solución: CoEvo-Mem

Los autores construyeron un marco llamado CoEvo-Mem (Memoria de Co-Evolución). Piensa en esto como una danza entre dos compañeros: el Router (el Bibliotecario) y el Banco de Memoria (el Tomador de Notas).

Así es como funciona la danza:

1. El Cerebro Congelado y el Router Inteligente
El "cerebro" principal de la IA (el Modelo de Lenguaje Extenso) permanece congelado: no aprende nada nuevo. En su lugar, el sistema utiliza un "Router" diminuto y ligero para decidir cómo pedir ayuda.

  • Cuando llega una pregunta, el cerebro congelado sugiere algunas formas de reescribir la pregunta (algunas centradas en el significado, otras en palabras clave específicas).
  • El Router luego aprende a retocar estas sugerencias basándose en si la IA obtuvo la respuesta correcta o incorrecta. Es como un entrenador que susurra: "Intenta preguntar de esta manera la próxima vez", basándose en el resultado del juego.

2. El Banco de Memoria como un Mapa Vivo
Las memorias no son solo una lista de notas; son un Grafo Relacional. Imagina un mapa donde cada memoria es una ciudad y las carreteras entre ellas muestran cómo están relacionadas.

  • Carreteras densas conectan memorias que significan lo mismo (semántica).
  • Carreteras dispersas conectan memorias que comparten palabras o nombres específicos (léxica).
  • Carreteras temporales conectan memorias que ocurrieron en una secuencia (temporal).

Cuando la IA resuelve una tarea, no solo guarda la respuesta. Actualiza el "valor" de las ciudades que visitó. Si una memoria ayudó a la IA a ganar, esa ciudad obtiene una puntuación más alta. Si ayudó, pero solo un poco, la puntuación sube un poco. Crucialmente, este crédito no se queda solo en esa memoria; viaja a lo largo de las carreteras hacia las ciudades vecinas, ayudando a todo el vecindario a volverse más inteligente.

3. La Danza Alternante (El Ingrediente Secreto)
Podrías pensar: "¿Por qué no actualizar el Router y la Memoria al mismo tiempo?". Los autores descubrieron que esto causa caos. Si ambos cambian a la vez, es como intentar aprender a montar en bicicleta mientras la bicicleta también está cambiando de forma. El sistema se confunde y se vuelve inestable.

En su lugar, CoEvo-Mem utiliza un programa alternante:

  • Fase 1: El Banco de Memoria está congelado (bloqueado en su lugar). El Router practica encontrando las mejores memorias usando este mapa fijo.
  • Fase 2: El Router está congelado (bloqueado en su lugar). El Banco de Memoria actualiza su organización y valores basándose en lo que el Router acaba de encontrar.
  • Alternan entre ambos. Esto permite que cada compañero aprenda del estado actual del otro sin la confusión de que ambos cambien simultáneamente.

Lo que Encontraron

El equipo probó CoEvo-Mem en siete desafíos muy diferentes:

  • Interacción con el Sistema Operativo: Controlar una computadora para realizar tareas.
  • Generación de Código: Escribir programas de computadora funcionales.
  • Razonamiento Multimodal: Resolver acertijos que involucran tanto texto como imágenes.
  • Preguntas Científicas: Responder preguntas difíciles sobre física, química y biología.
  • Llamada de Funciones (Function Calling): Enseñar a la IA a usar herramientas y APIs correctamente.
  • Conversación a Largo Plazo: Recordar detalles de chats largos.

En cada una de estas pruebas, CoEvo-Mem funcionó mejor que los mejores métodos existentes.

  • En el GPQA Diamond (preguntas científicas difíciles), mejoró la puntuación en 7.50 puntos porcentuales sobre la base de referencia más fuerte.
  • En LiveCodeBench (programación), mejoró en 3.81 puntos porcentuales.
  • En Memoria Conversacional de Largo Plazo (LoCoMo), alcanzó una puntuación de 81.71, superando al siguiente mejor método por casi 5 puntos.

Los autores también realizaron "estudios de ablación" (experimentos donde eliminaron partes del sistema) para demostrar por qué funcionó.

  • Cuando eliminaron la reescritura de consultas (la parte que cambia cómo se hace la pregunta), el rendimiento cayó significamente.
  • Cuando eliminaron la evolución de la memoria (la parte que actualiza el grafo y los valores), el rendimiento también cayó, especialmente en tareas complejas como programación y ciencia.
  • Cuando intentaron actualizar tanto el Router como la Memoria al mismo tiempo (en lugar de alternar), el sistema funcionó peor que el método alternante.

La Conclusión

El artículo sugiere que para que los agentes de IA dominen realmente las tareas a largo plazo, no podemos simplemente construir un mejor motor de búsqueda o una mejor base de datos. Tenemos que construir un sistema donde el motor de búsqueda y la base de datos aprendan a adaptarse el uno al otro. Al dejar que el "Bibliotecario" y el "Tomador de Notas" se turnen para aprender mientras el otro permanece quieto, CoEvo-Mem crea un bucle estable y de mejora continua que ayuda a los agentes de IA a recordar mejor, pensar con más claridad y resolver problemas más difíciles.

Los autores señalan cuidadosamente que, aunque los resultados son sólidos en estos siete parámetros, este es un marco específico para la co-evolución. No afirman que resuelva todos los problemas de la IA, pero demuestran que esta forma específica de vincular la recuperación y la memoria es un paso poderoso hacia adelante para construir agentes que puedan aprender y adaptarse con el tiempo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →