← Últimos artículos
💬 NLP

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

El artículo propone SePO, un marco autorreferencial que optimiza tanto los prompts de sistema de los agentes de tareas como el del propio agente de prompts mediante una búsqueda evolutiva de dos etapas, demostrando una generalización y un rendimiento superiores en diversos bancos de pruebas en comparación con los métodos existentes.

Autores originales: Wangcheng Tao, Han Wu, Weng-Fai Wong

Publicado 2026-06-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Wangcheng Tao, Han Wu, Weng-Fai Wong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico brillante pero obstinado (el Agente de Tarea) que necesita resolver acertijos difíciles, escribir código o hacer matemáticas. Para que este robot funcione mejor, le das un conjunto de instrucciones llamado "prompt del sistema".

Durante mucho tiempo, los humanos han sido quienes escriben estas instrucciones. Si el robot falla, un humano reescribe las instrucciones, lo intenta de nuevo y espera lo mejor. Algunos métodos nuevos utilizan a un "Entrenador" (el Agente de Prompt) para reescribir automáticamente estas instrucciones para el robot. Pero aquí está el problema: las propias instrucciones del Entrenador fueron escritas por un humano y nunca cambiaron. El Entrenador estaba atrapado con un manual fijo, escrito a mano, sin importar cuántas veces intentara ayudar al robot.

SePO (Optimización de Prompts Autoevolutiva) cambia las reglas del juego al permitir que el Entrenador se entrene a sí mismo.

La Gran Idea: El Entrenador Entrena al Entrenador

Piensa en SePO como un gimnasio para manuales de instrucciones de IA.

  • La Forma Antigua: Contratas a un entrenador personal (el Entrenador) para ayudar a un cliente (el Robot) a ponerse en forma. Pero el propio plan de entrenamiento del entrenador fue escrito por un humano y nunca se actualiza. El entrenador mejora en ayudar al cliente, pero el entrenador nunca se pone en forma.
  • La Forma SePO: El entrenador es también un cliente. El entrenador ayuda al cliente a ponerse en forma, pero el entrenador también utiliza sus propios métodos de entrenamiento para mejorar su propio plan de entrenamiento. El entrenador se vuelve más inteligente y fuerte, no solo el cliente.

Cómo Funciona: Dos Etapas de Entrenamiento

El artículo describe un proceso de dos pasos, similar a cómo los humanos aprenden una nueva habilidad:

Etapa 1: El "Campo de Entrenamiento" (Pre-entrenamiento)
Antes de que el Entrenador ayude a cualquier robot específico, va a un "campo de entrenamiento" con una gran variedad de desafíos (matemáticas, acertijos lógicos, programación, ciencia).

  • En esta etapa, el Entrenador intenta resolver estos problemas.
  • Cuando falla, critica sus propias instrucciones, las reescribe e intenta de nuevo.
  • Mantiene un "álbum de recortes" (un archivo) de sus mejores instrucciones. Si una nueva instrucción funciona mejor que una antigua, conserva la nueva.
  • El Resultado: El Entrenador evoluciona hasta convertirse en un instructor maestro con una "habilidad" general para corregir instrucciones, en lugar de solo memorizar un truco específico.

Etapa 2: El "Trabajo de Especialista" (Ajuste fino)
Ahora, el Entrenador es contratado para ayudar a un robot específico con un trabajo específico (por ejemplo, resolver Sudoku).

  • El Entrenador utiliza sus instrucciones evolucionadas y súper inteligentes para ayudar al robot.
  • Ajusta las instrucciones del robot para que se adapten al rompecabezas específico.
  • Debido a que el Entrenador aprendió cómo aprender en la Etapa 1, puede adaptarse rápidamente a nuevos trabajos sin necesidad de que un humano reescriba su propio manual primero.

Por qué esto Importa (Los Resultados)

Los investigadores probaron esto en cinco tipos de desafíos muy diferentes:

  1. Matemáticas (Problemas de competición difíciles)
  2. Razonamiento Abstracto (Acertijos de patrones visuales)
  3. Ciencia (Preguntas de nivel de posgrado)
  4. Programación (Escribir programas en Python)
  5. Lógica (Acertijos de Sudoku)

Compararon SePO contra:

  • Manual-CoT: Un humano escribiendo las instrucciones.
  • TextGrad: Un método que ajusta las instrucciones pero utiliza un crítico fijo escrito por un humano.
  • MetaSPO: Un método que aprende una regla global pero sigue dependiendo de un optimizador fijo escrito por un humano.

El Resultado:
SePO ganó en cada uno de los desafíos. En promedio, mejoró la precisión en 4.49 puntos en comparación con la base escrita por humanos.

  • No solo memorizó respuestas; aprendió una "habilidad" general de cómo escribir mejores instrucciones.
  • Incluso cuando se probó en un acertijo (Sudoku) que nunca vio durante su campo de entrenamiento, aun así funcionó mejor que los otros métodos. Esto demuestra que aprendió una habilidad transferible, no solo un truco específico.

La Analogía del "Jardín Evolutivo"

Imagina que las instrucciones son plantas en un jardín.

  • Métodos antiguos: Plantas semillas (instrucciones) y las riegas. Si una planta muere, eliges una nueva semilla de una bolsa y lo intentas de nuevo. El jardinero (el Entrenador) nunca cambia.
  • SePO: El jardinero es también una planta. El jardinero crece, evoluciona y mejora en la jardinería mientras cuida de las otras plantas. El jardín mantiene un registro de las mejores plantas (el archivo) y las utiliza como peldaños para cultivar plantas aún mejores. Eventualmente, el jardín produce un jardinero que es tan hábil que puede cultivar cualquier cosa, incluso plantas que nunca ha visto antes.

Resumen

SePO cierra el ciclo. En lugar de que un humano escriba un manual fijo para un entrenador de IA, SePO permite que el entrenador de IA escriba y mejore su propio manual. Esto convierte al entrenador de una herramienta estática en un compañero de aprendizaje que se vuelve más inteligente con la experiencia, lo que conduce a un mejor rendimiento en matemáticas, ciencia, programación y acertijos lógicos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →