Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents
Este artículo introduce "habilidades contractuales", un marco inspirado en GovernSpec que estructura las instrucciones de los agentes de IA empresariales como contratos de tareas legibles para mejorar la inspeccionabilidad de los objetivos, límites y criterios de calidad, demostrando mediante experimentos que este enfoque mejora la gobernanza y la mantenibilidad en lugar de servir como un mecanismo de seguridad independiente.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un asistente muy inteligente, rápido, pero a veces demasiado entusiasta para ayudarte a gestionar tu negocio. Le entregas una pila de instrucciones llamadas "Habilidades".
En la forma antigua de hacer las cosas, estas instrucciones eran como una carta larga y prolija. Podrías escribir: "Oye, al hablar con los clientes, sé amable, revisa la lista de precios y no prometas nada que no puedas cumplir". El asistente lo lee, asiente e intenta hacer lo mejor posible. Pero como las reglas están enterradas en párrafos de texto, el asistente podría olvidar revisar el precio, o peor aún, prometer accidentalmente un descuento que no tiene autorización para otorgar.
Este artículo propone una nueva forma de escribir estas instrucciones, llamada "Habilidades Contractuales".
La idea central: De una carta a una lista de verificación
En lugar de una carta larga, piensa en una Habilidad Contractual como un contrato laboral formal o una lista de verificación de vuelo.
El autor, Ting Liu, sugiere que cada habilidad debe tener casillas (campos) específicas y etiquetadas que el asistente debe completar o seguir:
- Objetivo: ¿Qué estamos intentando hacer exactamente?
- Entradas: ¿Qué información necesitamos antes de comenzar? (¡Si no tienes el ID del cliente, detente!)
- Permisos: ¿Qué herramientas tienes permitido tocar? (Puedes leer el correo electrónico, pero no puedes eliminar el archivo.)
- Puertas humanas: ¿Cuándo debes detenerte y pedir la aprobación de un jefe humano? (Por ejemplo: "Si el descuento supera el 10%, pausa y espera una firma".)
- Evidencia: ¿De dónde obtuviste tus hechos? (No adivines; muestra tus fuentes.)
- Salida: ¿Cómo debe verse el resultado final? (Un formato específico, no solo un párrafo aleatorio.)
¿Por qué hacer esto?
El artículo argumenta que cuando las reglas están ocultas en "prosa" (texto largo), es fácil pasarlas por alto. Cuando están en casillas etiquetadas, se vuelven imposibles de ignorar.
- Analogía: Imagina a un piloto volando un avión. Si las reglas de seguridad están escritas en una novela, el piloto podría saltarse un paso. Si las reglas están en una lista de verificación con casillas para marcar, el piloto debe marcarlas. Las Habilidades Contractuales convierten las instrucciones de la IA en esa lista de verificación.
¿Qué probaron?
Los investigadores realizaron dos experimentos principales para ver si este enfoque de "lista de verificación" funciona mejor que el enfoque de "carta larga".
1. La prueba de escritura (Generación de texto)
Pidieron a diferentes modelos de IA que realizaran tareas como escribir correos electrónicos de ventas, revisar contratos o verificar código. Compararon cuatro versiones:
- Sin habilidad: Solo un prompt básico.
- Habilidad mínima: Una instrucción corta y simple.
- Habilidad expandida simple: Una instrucción larga y detallada (como la antigua "carta prolija").
- Habilidad Contractual: La misma información detallada, pero organizada en el estricto formato de "lista de verificación".
El resultado: Las "Habilidades Contractuales" produjeron consistentemente resultados mejores, más estructurados y más seguros que no tener habilidad o tener una habilidad mínima. En comparación con la versión "Expandida simple" (que tenía la misma cantidad de información), la versión Contractual fue ligeramente mejor en adherirse a las reglas y al formato, aunque la diferencia no fue enorme. La principal victoria fue que el resultado fue más fácil de revisar y verificar.
2. La prueba de "No toques eso" (Llamada a herramientas)
Dieron a la IA acceso a herramientas simuladas, incluidas algunas "peligrosas" (como eliminar archivos o enviar dinero) que se suponía debían estar bloqueadas. Observaron si la IA intentaba usarlas.
El resultado:
- Buenas noticias: Usar cualquier tipo de habilidad (incluso una simple) hizo que la IA fuera menos propensa a intentar acciones peligrosas.
- El problema: La "Habilidad Contractual" no detuvo mágicamente a la IA de intentar romper las reglas en cada caso individual. Algunos modelos aún intentaron usar las herramientas peligrosas.
- La lección: La habilidad actúa como un letrero de advertencia o un código de normas que le dice a la IA lo que debería suceder, pero no puede detener físicamente a la IA de intentarlo. Aún necesitas un "guardia de seguridad" (límites de ejecución) para bloquear físicamente la acción mala. La habilidad simplemente hace que la IA sea más inteligente sobre cuándo detenerse.
La conclusión
Este artículo no afirma que las Habilidades Contractuales hagan a la IA perfectamente segura ni que reemplacen la supervisión humana. En cambio, afirma que hacen que la descripción del trabajo de la IA sea mucho más clara.
- Antes: "Aquí tienes una carta larga de instrucciones. ¡Buena suerte!"
- Después: "Aquí tienes un contrato con casillas claras para 'Qué hacer', 'Qué evitar' y 'Cuándo pedir ayuda'".
Esto facilita que los humanos revisen el trabajo de la IA, facilita probar si la IA está siguiendo las reglas y ayuda a la IA a comprender los límites de su trabajo. Convierte un "prompt" vago en un activo organizacional manejable.
En resumen: Las Habilidades Contractuales no convierten a la IA en un superhéroe; simplemente le dan un mapa mejor y un conjunto de reglas más claro para que no se pierda o estrelle el coche accidentalmente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.