← Últimos artículos
🤖 AI

Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

Socratic-SWE introduce un marco de autoevolución de bucle cerrado que transforma las trazas de resolución históricas de un agente en habilidades estructuradas para generar tareas de reparación dirigidas y verificables, permitiendo así una mejora continua y logrando un rendimiento de vanguardia en los benchmarks de SWE sin depender de procedimientos de mutación fijos.

Autores originales: Chuan Xiao, Zhengbo Jiao, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang, Lin Qu

Publicado 2026-06-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chuan Xiao, Zhengbo Jiao, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang, Lin Qu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo arreglar software roto. Normalmente, tienes que escribir miles de "tareas de la escuela" específicas para el robot, encontrar las respuestas y calificarlas. Esto es costoso, lento y, a menudo, la tarea no coincide con los puntos débiles reales del robot.

El artículo presenta Socratic-SWE, una nueva forma de entrenar a estos robots de programación. En lugar de que un profesor entregue tareas estáticas, el robot se enseña a sí mismo analizando sus propios errores y aciertos, convirtiéndolos en una guía de estudio personalizada.

Así es como funciona, utilizando analogías sencbles:

1. La forma antigua: El libro de texto estático

Imagina a un estudiante tratando de aprender carpintería. En el método antiguo, un profesor le entrega una pila de 1,000 planos preescritos para reparar.

  • El problema: Algunos planos son demasiado fáciles (el estudiante ya sabe cómo arreglarlos) y otros son imposibles (el estudiante aún no tiene las herramientas adecuadas). El profesor no sabe en qué está teniendo dificultades el estudiante en este momento.
  • El resultado: El estudiante pierde el tiempo en cosas que ya sabe o se queda estancado en cosas que no puede resolver y, eventualmente, deja de mejorar.

2. La nueva forma: Socratic-SWE (El aprendiz autodidacta)

Socratic-SWE cambia las reglas del juego. Crea un bucle cerrado donde el robot actúa tanto como estudiante como profesor.

Paso 1: La "Traza" (La repetición de video)

Cada vez que el robot intenta arreglar un error (bug), deja atrás una "huella digital" llamada traza. Esto es como una repetición de video de todo el proceso de pensamiento del robot:

  • ¿Dónde buscó?
  • ¿Qué código cambió?
  • ¿Pasó o falló la prueba?
  • ¿Rompió accidentalmente algo más?

En el pasado, los investigadores solo usaban estas repeticiones para dar una calificación simple de "Aprobado" o "Reprobado" y luego desechaban el video. Socratic-SWE dice: "¡Espera! Veamos el video otra vez".

Paso 2: Destilar "Habilidades" (La guía de estudio)

El sistema observa todas las repeticiones y busca patrones.

  • Si el robot falló: Nota: "Ah, cada vez que intento arreglar un archivo con tres pestañas abiertas, olvido guardar el primero".
  • Si el robot tuvo éxito: Nota: "Cuando reviso el registro de errores antes de editar, generalmente lo logro".

Convierte estos patrones en un "Registro de Habilidades del Agente" estructurado. Piensa en esto como una Guía de Estudio personalizada o una Hoja de Trucos de un Entrenador. Enumera exactamente en qué es malo el robot (por ejemplo, "No olvides verificar los efectos secundarios") y en qué es bueno.

Paso 3: Generar nueva tarea (El cuestionario personalizado)

Ahora, el robot utiliza esta Guía de Estudio para crear nueva tarea.

  • En lugar de elegir errores al azar, el robot pregunta: "Basado en mi Guía de Estudio, sigo fallando en 'ediciones de múltiples archivos'. Déjenme crear un nuevo error difícil que específicamente requiera que edite tres archivos a la vez".
  • Esto asegura que la tarea esté perfectamente dirigida a las debilidades actuales del robot.

Paso 4: El "Verificador" Guardián

Antes de que se le entregue la nueva tarea al robot, un estricto Guardián la revisa.

  • ¿Realmente existe el error?
  • ¿Puede el robot realmente arreglarlo?
  • ¿Es la prueba confiable?
    Si la tarea está rota o es imposible, se desecha. Solo las tareas de alta calidad y resolubles llegan al grupo de entrenamiento.

El "Alineamiento de Gradiente" (La brújula)

Hay un truco más ingenioso. El sistema no solo quiere que el robot resuelva cualquier problema; quiere que mejore en las cosas correctas.

  • Imagina una brújula. El sistema tiene una "dirección de confianza" (un conjunto de tareas conocidas de alta calidad).
  • Cuando el robot genera una nueva tarea, el sistema pregunta: "¿Resolver esta nueva tarea mueve al robot en la misma dirección que nuestra brúcula de confianza?".
  • Si la respuesta es sí, la tarea se mantiene. Si no, se descarta. Esto evita que el robot aprenda "trucos" que solo funcionan en problemas falsos.

Los resultados: Volviéndose más inteligente más rápido

Los investigadores probaron esto en cuatro bancos de pruebas importantes (como exámenes finales para agentes de programación).

  • La línea base: Un robot estándar entrenado con datos fijos.
  • La competencia: Otros robots que intentan enseñarse a sí mismos pero sin este método específico de "Registro de Habilidades".
  • Socratic-SWE: Después de solo tres rondas de autoaprendizaje, obtuvo un 50.4% en la prueba más difícil (SWE-bench Verified). Este fue un gran salto en comparación con los otros, que se estancaron o mejoraron muy lentamente.

Por qué esto es importante

El artículo afirma que Socratic-SWE demuestra que no necesitas a un humano para escribir interminables tareas nuevas. Al reutilizar la propia historia del robot (trazas) para construir una guía de habilidades, el robot puede generar continuamente su propio currículo. Convierte los fracasos pasados del robot en su combustible futuro, permitiéndole evolucionar y mejorar sin necesidad de un flujo constante de profesores humanos.

En resumen: Es como un robot que observa sus propias repeticiones de juego, escribe su propia guía de estudio, crea sus propios ejercicios de práctica y luego toma un examen para ver si realmente mejoró. Y resulta que este método de auto-entrenamiento funciona mejor que tener a un humano entregando las mismas hojas de trabajo de siempre.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →