← Últimos artículos
🤖 AI

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

Este artículo presenta SAPO, un método de optimización automática de prompts a nivel de segmento que descompone los prompts en componentes distintos para atacar debilidades específicas y supera a los enfoques monolíticos existentes en diversos benchmarks.

Autores originales: Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

Publicado 2026-08-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un robot superinteligente a escribir una historia, resolver un problema matemático o resumir un artículo de noticias. Lo haces dándole un conjunto de instrucciones, que los científicos llaman un "prompt". Piensa en un prompt como una receta: si las instrucciones son vagas o desordenadas, el robot podría hornear un pastel que sepa a jabón en lugar de chocolate. Durante mucho tiempo, los investigadores intentaron arreglar estas recetas reescribiendo toda la receta desde cero cada vez que el robot cometía un error. Era como tirar un pastel entero a la basura porque el glaseado estaba ligeramente mal, con la esperanza de que el siguiente intento fuera perfecto. Este método, conocido como optimización "monolítica", a menudo funcionaba bien para una parte de la tarea, pero accidentalmente arruinaba otra, dejando al robot confundido y los resultados inconsistentes.

El artículo que vas a leer aborda este problema con un nuevo enfoque llamado SAPO (Optimización Automática de Prompts a Nivel de Segmento). En lugar de tirar toda la receta, SAPO actúa como un maestro chef que prueba cuidadosamente el pastel, identifica exactamente qué ingrediente está mal (tal vez demasiada sal, o poca azúcar) y arregla solo esa parte mientras deja intactas las partes perfectas. Los autores probaron este método en cinco tipos diferentes de tareas, desde responder preguntas de comprensión lectora hasta resolver problemas matemáticos complejos, utilizando dos cerebros robóticos diferentes (GPT-3.5-Turbo y GPT-4o-mini). Descubrieron que, al dividir las instrucciones en piezas más pequeñas y manejables y solo arreglar los puntos débiles, podían obtener resultados mucho mejores que los métodos anteriores, mejorando el rendimiento hasta en un 7.25% en algunas tareas.

La Receta para un Mejor Robot

Sumerjámonos en cómo funciona esto. Imagina que le estás dando a un robot un manual de instrucciones muy largo y complicado. En el pasado, si el robot obtenía la respuesta incorrecta, un optimizador automático intentaba reescribir todo el manual de una sola vez. Es como intentar arreglar el motor de un coche reemplazando el coche entero. A veces, este nuevo coche funciona de maravilla para conducir, pero es terrible para estacionar. El viejo método a menudo hacía que el robot fuera mejor en una cosa pero peor en otra, un problema que los autores llaman "deriva del prompt" (prompt drifting).

Los autores de este artículo, Nikita Kulin y su equipo, sugieren una forma más inteligente. Se dieron cuenta de que un buen manual de instrucciones no es solo un gran bloque de texto; está compuesto por diferentes secciones, como los capítulos de un libro. Ellos dividen el prompt en cuatro segmentos específicos:

  1. Rol: ¿Quién se supone que debe ser el robot? (ej. "Eres un historiador servicial").
  2. Contexto: ¿Cuál es la historia de fondo o la situación? (ej. "Estás hablando con un estudiante").
  3. Tareas: ¿Qué es exactamente lo que el robot debe hacer? (ej. "Resume este texto en tres frases").
  4. Formato de Salida: ¿Cómo debe verse la respuesta? (ej. "Dame una lista con viñetas").

El Juego de Detective de SAPO

El nuevo método, SAPO, trata estos cuatro segmentos como pistas en un juego de detectives. Aquí está el proceso paso a paso que utilizan:

Primero, el sistema somete al robot a una sesión de entrenamiento con un montón de ejemplos. Observa los resultados y selecciona los 5 mejores ejemplos (donde el robot acertó) y los 5 peores ejemplos (donde el robot falló).

Después, el sistema juega a ser detective. Le pide a un segundo robot, más inteligente (actuando como juez), que observe los 5 mejores y los 5 peores ejemplos y determine por qué el robot tuvo éxito o fracasó. ¿El segmento de "Rol" confundió al robot? ¿La "Tarea" era demasiado vaga? El juez identifica qué segmentos fueron "fuertes" (que funcionaron bien en los ejemplos buenos) y cuáles fueron "débiles" (que causaron problemas en los ejemplos malos).

Luego viene la parte mágica: Síntesis Restringida. En lugar de reescribir todo el manual, el sistema genera nuevas versiones del prompt que mantienen los segmentos fuertes exactamente como están y solo cambian los débiles. Es como mantener la masa perfecta de un pastel de chocolate pero cambiar el glaseado quemado por una tanda fresca. Esto asegura que las partes de la instrucción que ya estaban funcionando no se rompan accidentalamente.

Finalmente, el sistema prueba estos nuevos prompts parcialmente revisados en un conjunto de preguntas diferente (el conjunto de validación). Si el nuevo prompt funciona mejor, se acepta. Si no, el sistema mantiene el anterior. Esto sucede una y otra vez hasta que el robot es tan bueno como puede llegar a ser.

Los Resultados: Un Ganador Claro

El equipo probó este método en cinco desafíos muy diferentes:

  • SQuADv2: Responder preguntas basadas en un pasaje de lectura.
  • TweetEval: Clasificar el estado de ánimo de los tweets.
  • XSUM: Resumir artículos de noticias.
  • CommonGen: Crear oraciones a partir de una lista de palabras.
  • GSM8K: Resolver problemas matemáticos de nivel escolar.

Realizaron estas pruebas en dos modelos de robot diferentes: GPT-3.5-Turbo y GPT-4o-mini. Los resultados fueron bastante impresionantes. Cuando se comparó con otros métodos populares que reescriben todo el prompt a la vez (como APE, OPRO y EvoPrompt), SAPO puntuó consistentemente más alto en promedio.

En el modelo GPT-3.5-Turbo, SAPO mejoró el puntaje promedio en un 5.13% en comparación con el siguiente mejor método. En el más avanzado GPT-4o-mini, la mejora fue aún mayor, saltando un 7.25% por encima de la competencia. Las mayores victorias ocurrieron en tareas que requieren respuestas muy estrictas, como los problemas matemáticos (GSM8K) y la comprensión lectora (SQuAD2), donde un pequeño error en las instrucciones puede llevar a una respuesta completamente errónea.

Por Qué Esto Importa

Los autores sugieren que este éxito ocurre porque SAPO detiene la "interferencia destructiva" que sucede cuando cambias todo a la vez. Al localizar los cambios solo en las partes débiles del prompt, el sistema preserva las partes que ya están funcionando perfectamente. Es un enfoque más cuidadoso y quirúrgico para enseñar a los robots.

Sin embargo, el artículo también señala algunas limitaciones. El método actual utiliza un conjunto fijo de cuatro segmentos. Si bien esto funciona bien para muchas tareas, podría no ser lo suficientemente detallado para cada tipo de problema individual. Los autores sugieren que las versiones futuras podrían permitir que el robot descubra automáticamente nuevos tipos de segmentos si es necesario, en lugar de limitarse a estos cuatro.

En resumen, SAPO demuestra que cuando quieres enseñar a un robot superinteligente, a veces la mejor manera de arreglar un error no es empezar de nuevo, sino identificar cuidadosamente qué salió mal y arreglar solo esa pieza. Es un cambio de "reescribir todo" a "arreglar lo que está roto", y por ahora, parece ser la estrategia ganadora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →