← Últimos artículos
💻 computer science

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

SWE-MeM es un marco de entrenamiento que dota a los agentes de ingeniería de software con capacidades de gestión de memoria adaptativas y bajo demanda a través de una herramienta flexible y un GRPO consciente de la memoria, permitiéndoles optimizar dinámicamente el uso del contexto y lograr un rendimiento superior en tareas de programación de largo horizonte en comparación con los métodos estáticos existentes.

Autores originales: Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El embotellamiento de "Demasiada Información"

Imagina que eres un brillante detective de software (un agente de IA) contratado para solucionar un error en un edificio masivo y complejo (un repositorio de código). Comienzas tu investigación, pero a medida que trabajas, dejas un rastro de notas, fotos y grabaciones de cada uno de los pasos que das.

  • El Problema: En el mundo real, estas "notas" (el historial de la conversación) se van acumulando. Eventualmente, la pila se vuelve tan grande que bloquea la puerta. Tu cerebro de detective (el modelo de IA) tiene un espacio limitado para mirar las cosas a la vez (la "ventana de contexto"). Si la pila se vuelve demasiado grande, o bien no puedes ver las nuevas pistas, o te sientes tan abrumado por detalles irrelevantes del pasado que olvidas lo que realmente intentabas resolver.
  • La Forma Antigua: Los métodos anteriores intentaban resolver esto siendo rígidos. Eran como un bibliotecario estricto que dice: "Cada vez que escribas 100 páginas, eliminaré automáticamente las primeras 50 y las reemplazaré con un resumen genérico". Esto es malo porque, a veces, las primeras 50 páginas contienen la única pista que necesitas, y otras veces las últimas 50 páginas son solo tú quejándote del clima (lo cual puedes descartar con seguridad).

La Solución: SWE-MeM (El Asistente Personal Inteligente)

Los autores crearon SWE-MeM, un nuevo marco de entrenamiento que enseña al agente de IA a ser su propio asistente personal inteligente. En lugar de un bibliotecario rígido, el agente aprende a gestionar su propia memoria de forma proactiva.

Así es como funciona, dividido en tres partes sencillas:

1. La Herramienta Flexible (Decidir Cuándo y Qué)

SWE-MeM le da al agente una herramienta especial llamada compress (comprimir). El agente aprende a preguntarse tres cosas antes de usarla:

  • ¿Cuándo? ¿Necesito limpiar ahora? (¿Se está desordenando demasiado mi escritorio?)
  • ¿Qué? ¿Qué partes de mis notas son basura? (¿Es una larga lista de intentos de prueba fallidos, o es un fragmento de código crítico?)
  • ¿Cómo? ¿Cómo resumo esto? (¿Solo guardo la conclusión, o mantengo el mensaje de error específico?)

Analogía: Imagina que estás escribiendo un diario. Un sistema rígido borra la primera página cada vez que escribes una nueva. SWE-MeM es como un editor inteligente que mira tu diario y dice: "Oye, pasaste tres días simplemente mirando una pared blanca (bajo valor). Resumamos eso como 'Día 3: Atascado'. Pero encontraste la tubería rota en el Día 5 (alto valor). Mantengamos ese detalle exactamente como está".

2. El Método de Entrenamiento (Aprender Haciendo)

¿Cómo se le enseña a una IA a ser así de inteligente? No basta con decírselo; tiene que practicar. Los autores utilizaron un proceso de entrenamiento de tres pasos:

  • Síntesis de Trayectorias (La Simulación): Crearon miles de "casos de detectives" falsos. Utilizaron una IA superinteligente para actuar como juez, decidiendo cuándo el detective debería haber limpiado sus notas. Construyeron un conjunto de datos donde el agente practica comprimiendo las cosas correctas en los momentos adecuados.
  • Aprendizaje por Currículo (Escolarización): Le enseñaron al agente por etapas. Primero, le enseñaron lo básico: "Así es como escribes un resumen". Una vez que dominó eso, pasaron a la clase avanzada: "Ahora, aprende a resumir antes de quedarte sin espacio, no solo cuando te ves obligado a ello". Esto es como enseñarle a un estudiante a hacer la maleta antes del viaje, en lugar de esperar hasta que la bolsa esté a punto de reventar.
  • GRPO con Conciencia de Memoria (El Sistema de Recompensas): Esta es la parte más técnica, pero piénsalo como un sistema de puntuación de un videojuego.
    • En el entrenamiento normal, la IA solo recibe un punto de "Victoria" si arregla el error al final.
    • En SWE-MeM, el sistema observa todo el viaje. Si la IA tomó una excelente decisión de compresión en medio del proceso que le ayudó a resolver el problema más tarde, recibe un punto de bonificación. Si comprimió algo importante y se quedó atascado, recibe una penalización. Esto enseña a la IA que una buena gestión de la memoria es parte de ganar el juego.

3. Los Resultados (Ganar el Juego)

Los autores probaron SWE-MeM en SWE-Bench Verified, un benchmark exigente donde los agentes de IA tienen que solucionar errores de software del mundo real.

  • La Puntuación: Con un modelo pequeño (4 mil millones de parámetros), SWE-MeM resolvió el 43.4% de los problemas. Con uno más grande (30 mil millones), resolvió el 60.2%.
  • La Eficiencia: No solo resolvió más problemas, sino que también utilizó menos tokens (palabras/caracteres) y dio menos pasos que otros métodos.
  • La Comparación: Superó a todos los métodos anteriores de "bibliotecario rígido". Demostró que dejar que el agente decida cuándo limpiar su memoria es mucho mejor que obligarlo a limpiar según un horario.

Resumen

SWE-MeM es como actualizar a un detective de alguien que tritura papeles frenéticamente cuando el escritorio se llena, a un detective que sabe exactamente qué pistas conservar, cuáles resumir y cuándo ordenar su escritorio para que pueda seguir resolviendo casos de manera eficiente sin quedarse sin espacio. Le enseña a la IA a ser proactiva, flexible y eficiente, lo que resulta en mejores correcciones de código con menos esfuerzo desperdiciado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →