← Últimos artículos
🤖 AI

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

FAPO es un marco de trabajo totalmente autónomo que optimiza los procesos de LLM de múltiples pasos mediante la evaluación, el diagnóstico y el refinamiento iterativo tanto de los prompts como de las estructuras de cadena, logrando un rendimiento de vanguardia en evaluaciones generales y de seguridad al superar la línea base de GEPA.

Autores originales: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Publicado 2026-06-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un equipo de robots trabajando juntos para resolver un rompecabezas complejo. Cada robot tiene un trabajo específico: uno encuentra pistas, otro reflexiona sobre ellas y un tercero escribe la respuesta final. A veces, todo el equipo falla, pero es difícil saber qué robot cometió el error. ¿Falló el primero al no encontrar una pista? ¿Se confundió el segundo? ¿O escribió el tercero la respuesta en un formato incorrecto?

Este es el problema con los pipelines de LLM multi-paso (cadenas complejas de tareas de IA). Los métodos tradicionales intentan arreglar a todo el equipo simplemente reescribiendo las instrucciones dadas al robot "jefe" (el prompt). Pero si el problema es que al equipo le falta un paso o que los robots están hablando con las personas equivocadas, cambiar las instrucciones no servirá de nada.

Entra en escena FAPO (Optimización de Prompts Totalmente Autónoma). Piensa en FAPO como un gestor de proyectos superinteligente y autónomo (impulsado por una IA llamada Claude Code) que no solo reescribe instrucciones, sino que observa a todo el equipo trabajar, encuentra el cuello de botella exacto y lo soluciona.

Así es como funciona FAPO, utilizando analogías sencillas:

1. La Fase de Detective (Inspección)

En lugar de adivinar, FAPO observa al equipo resolver un rompecabezas de práctica. Registra cada movimiento, cada pista encontrada y cada proceso de pensamiento. Si el equipo obtiene la respuesta incorrecta, FAPO actúa como un detective:

  • "¿Fallamos porque no encontramos la pista correcta?" (Fallo de recuperación/retrieval)
  • "¿Encontramos la pista pero la malinterpretamos?" (Fallo de razonamiento)
  • "¿La entendimos pero escribimos la respuesta en un formato incorrecto?" (Fallo de formato)

2. La Regla de "Arreglar Primero" (Ediciones de Prompts)

FAPO sigue una regla estricta: Empezar poco a poco.
Si el detective descubre que el equipo solo necesita instrucciones más claras, FAPO reescribe el prompt (las instrucciones). Es como decirle a los robots: "Oye, busca la caja roja, no la azul". Intenta esto primero porque es la solución más fácil.

3. La Fase de "Rediseño" (Cambios Estructurales)

Si FAPO intenta reescribir las instrucciones una y otra vez, pero el equipo sigue fallando porque le falta un paso crucial (como la necesidad de un cuarto robot para revisar las matemáticas), FAPO recibe permiso para cambiar la estructura del equipo.

  • Podría añadir un nuevo robot al equipo.
  • Podría cambiar el orden en el que los robots se comunican entre sí.
  • Podría añadir un paso de "control de seguridad" que obligue al equipo a seguir reglas específicas antes de escribir la respuesta final.

Esta es la diferencia clave: FAPO solo cambia la estructura del pipeline si demuestra que cambiar las palabras (prompts) no es suficiente.

4. El Inspector de Seguridad (Guardrails)

Antes de que FAPO realice cualquier cambio, un "Inspector de Seguridad" (otro agente de IA) revisa el plan. Esto asegura que FAPO no elimine accidentalmente reglas importantes, filtre datos privados o rompa el sistema de puntuación. Es como un inspector de edificios revisando un plan de renovación antes de que el equipo de construcción comience.

Los Resultados: ¿Qué tan bien funcionó?

El artículo probó FAPO contra otra herramienta llamada GEPA (que es como un editor muy bueno que solo reescribe instrucciones) a través de seis tipos diferentes de desafíos, desde problemas matemáticos hasta tareas de seguridad.

  • El Marcador: FAPO ganó 15 de 18 veces.
  • Las Grandes Victorias: En las tareas más difíciles (como la verificación de hechos en historias complejas o el seguimiento de reglas de formato estrictas), FAPO no solo ajustó las instrucciones; se dio cuenta de que el equipo necesitaba una nueva estructura. En estos casos, las puntuaciones de FAPO aumentaron por márgenes enormes (hasta +33.8 puntos porcentuales mejor que la competencia).
  • Tareas de Seguridad: FAPO también mejoró la capacidad de los modelos de IA para identificar vulnerabilidades de seguridad (como mapear errores de software con sus causas), demostrando que funciona para trabajos serios y de alto riesgo también.

La Única Excepción

Hubo una competencia de matemáticas (AIME) donde FAPO no ganó. Los autores sugieren que esto puede deberse a que los problemas matemáticos eran tan difíciles y la muestra tan pequeña que la IA se "confundió" o se sobreajustó (over-fitted) a los problemas de práctica, en lugar de aprender realmente mejor las matemáticas.

Resumen

FAPO es como un gestor inteligente que no se limita a gritarle a los trabajadores que "lo hagan mejor". En su lugar, observa el flujo de trabajo, diagnostica exactamente dónde se rompe el proceso, arregla primero las instrucciones y, solo si eso falla, rediseña todo el flujo de trabajo para que el equipo sea más efectivo. Convierte una cadena desordenada y fallida de pasos de IA en una máquina fiable y de alto rendimiento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →