← Últimos artículos
🤖 AI

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

Este artículo presenta CAPO, un método de optimización de prompts consciente de las restricciones que utiliza un enfoque primal-dual con ponderación de restricciones adaptativa para optimizar eficazmente los prompts del sistema de agentes de LLM para el rendimiento de las tareas mientras se adhiere a restricciones operativas como la seguridad y el formato, junto con una variante dinámica (DCAPO) que entrena a un reescritor especializado para lograr prompts factibles y de alto rendimiento a través de diversos dominios sin modificar el agente de la tarea subyacente.

Autores originales: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos se están desplegando cada vez más no solo para charlar, sino para actuar. A estos agentes digitales se les entrega un conjunto de instrucciones, conocido como system prompt, que les indica cómo usar herramientas, resolver problemas e interactuar con los usuarios. Imagine a un agente de viajes que puede reservar vuelos, verificar seguros y cancelar reservaciones, pero solo si sigue un estricto conjunto de reglas de la empresa. El desafío para los desarrolladores es que un modelo puede ser increíblemente bueno resolviendo una tarea y, aun así, fallar en cumplir con los requisitos operativos específicos de un trabajo del mundo real. Podría usar demasiadas herramientas, pedir ayuda humana cuando no debería, escribir respuestas demasiado largas o violar accidentalmente las políticas de seguridad. Para que una empresa despliegue tal agente, no puede simplemente aceptar un modelo que sea "mayormente" bueno; debe asegurar que el agente se mantenga dentro de límites estrictos para cada uno de los requisitos mientras sigue cumpliendo con su labor.

La dificultad central radica en el hecho de que estos requisitos a menudo tiran en diferentes direcciones. Un prompt que hace que un agente sea muy preciso también podría hacerlo verboso o propenso a usar demasiadas herramientas. Tradicionalmente, los desarrolladores han intentado resolver esto ajustando manualmente la importancia de cada regla, esencialmente adivinando qué restricciones importan más. Sin embargo, este enfoque es frágil. Una configuración que funciona para un tipo de tarea o para un modelo específico a menudo falla cuando la situación cambia. Si las reglas se fijan de antemano, el sistema podría satisfacer un requisito rompiendo otro, dejando al agente inutilizable para el despliegue. La pregunta que los investigadores enfrentaron fue si podrían construir un sistema que encuentre automáticamente el equilibrio perfecto, ajustando el peso de cada regla en tiempo real a medida que aprende qué funciona y qué no.

Un equipo de investigadores introdujo un nuevo método llamado CAPO, que significa Optimización de Prompts Consciente de las Restricciones (Constraint-Aware Prompt Optimization), para abordar este problema. En lugar de adivinar el equilibrio adecuado de las reglas, CAPO trata el proceso de optimización como una negociación donde las propias reglas alzan la voz. El sistema comienza con una colección de prompts candidatos y los prueba contra un conjunto de tareas. A medida que los agentes se ejecutan, generan datos sobre qué tan bien se desempeñaron y, crucialmente, cuánto violaron restricciones específicas, como el número de llamadas a herramientas o la longitud de la respuesta. Si un prompt viola una regla, el sistema aumenta automáticamente la "penalización" para esa regla específica en la siguiente ronda de pruebas. Si un prompt tiene margen adicional bajo una regla, la penalización para esa regla disminuye. Este ajuste dinámico permite que el sistema concentre su búsqueda en los problemas específicos que actualmente están impidiendo el despliegue del agente, en lugar de tratar todas las reglas como igualmente importantes desde el principio.

Los investigadores probaron este enfoque en varios dominios diferentes, incluyendo servicio al cliente de aerolíneas, soporte minorista y telecomunicaciones. En estas pruebas, los agentes tuvieron que completar tareas mientras cumplían con límites estrictos sobre cuántas veces podían llamar a un agente humano, cuántas herramientas podían usar y qué tan largas podían ser sus instrucciones del sistema. Los resultados fueron claros: CAPO encontró consistentemente prompts que satisfacían cada una de las restricciones manteniendo un alto rendimiento en las tareas. En contraste, otros métodos que utilizaban pesos fijos o reglas estáticas fallaron en encontrar una solución que funcionara para todos los requisitos simultáneamente. Por ejemplo, en el dominio de las aerolíneas, mientras que otros métodos lograron satisfacer las reglas en solo uno de seis escenarios de prueba diferentes, CAPO encontró una solución factible en cada uno de ellos. El método demostró ser lo suficientemente robusto como para funcionar con diferentes tamaños de modelos de lenguaje e incluso se extendió más allá de los agentes que usan herramientas para manejar restricciones de seguridad y de formato en escenarios de chatbots.

Para hacer el proceso aún más eficiente, los investigadores desarrollaron una segunda versión llamada DCAPO. Mientras que la primera versión utiliza un modelo de lenguaje separado y congelado para reescribir los prompts, DCAPO entrena a un reescritor especializado para aprender del proceso mismo. Este reescritor observa el comportamiento del agente y la retroalimentación de las restricciones, aprendiendo a generar mejores prompts con el tiempo sin cambiar nunca al agente de la tarea subyacente. En sus experimentos, este reescritor aprendido fue capaz de producir prompts factibles en todos los dominios probados, igualando o mejorando la precisión de los mejores métodos de referencia. El estudio también incluyó un análisis matemático para mostrar cómo el sistema maneja el hecho de que está trabajando con un número limitado de ejemplos y cambios de texto discretos, confirmando que los errores introducidos por estas limitaciones no impiden que el sistema converja en una buena solución.

La significancia de este trabajo reside en su capacidad para convertir los requisitos de despliegue en una fuerza guía para el proceso de búsqueda. Al permitir que las violaciones medidas de las reglas determinen qué fallos reciben atención, el sistema evita la trampa de arreglar un problema solo para crear otro. Los investigadores encontraron que este enfoque adaptativo es esencial porque la restricción más crítica cambia dependiendo de la tarea específica y del modelo que se esté utilizando. Lo que más importa en un escenario de aerolínea puede ser irrelevante en un entorno minorista, y un modelo que es lo suficientemente capaz para resolver un problema podría necesitar una guía diferente para mantenerse dentro del presupuesto. El estudio demuestra que, al ajustar continuamente el enfoque de la optimización basándose en la retroalimentación en tiempo real, es posible encontrar puntos de operación que sean tanto efectivos como conformes. Esto sugiere un cambio en cómo pensamos sobre la ingeniería de prompts: en lugar de una configuración estática, puede ser un proceso dinámico donde los propios requisitos ayudan a dirigir el sistema hacia una solución que esté lista para el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →