← Últimos artículos
🤖 AI

Language-Based Agent Control

Este artículo introduce el Control de Agentes Basado en Lenguaje (LBAC), un modelo de programación que garantiza que las aplicaciones de agentes cumplan con las políticas de seguridad especificadas por el usuario al exigir que los agentes generen programas correctamente tipados que se verifiquen estáticamente antes de su ejecución, uniendo así las garantías de seguridad tanto en la estructura escrita por el desarrollador como en el comportamiento generado por el agente, al tiempo que preserva la expresividad computacional.

Autores originales: Timothy Zhou, Loris D'Antoni, Nadia Polikarpova

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Timothy Zhou, Loris D'Antoni, Nadia Polikarpova

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un asistente muy talentoso pero impredecible (un agente de IA) para realizar una tarea por ti, como organizar tus artículos de investigación. Quieres que sea creativo e inteligente, pero también necesitas asegurarte de que no borre accidentalmente (o maliciosamente) tus archivos, robe tus secretos o invente datos falsos.

Actualmente, la mayoría de los sistemas te obligan a elegir entre seguridad y libertad:

  • El enfoque de la "Caja de Juguetes" (Herramientas Restringidas): Le das al asistente una pequeña caja de herramientas preaprobadas. No puede salirse de la caja. Es muy seguro, pero no puede hacer nada ingenioso o complejo. Si necesita ordenar una lista, tiene que pedirte que lo hagas uno por uno.
  • El enfoque de la "Cocina Abierta" (Interpretes de Código): Le das al asistente acceso total a la cocina. ¡Puede cocinar lo que quiera! Pero si se confunde o es engañado, podría quemar la casa o servirtiempo veneno.

Este artículo presenta una nueva forma llamada Control de Agentes Basado en Lenguaje (LBAC). Piénsalo como darle al asistente una cocina mágica donde las leyes de la física (las reglas del universo) están escritas en un idioma que debe hablar.

La Idea Central: El "Idioma Mágico"

En lugar de simplemente darle al asistente una lista de "qué hacer y qué no hacer", los programadores construyen todo el sistema dentro de un lenguaje especial y estricto (como una versión superestricta de un lenguaje de programación llamado Haskell).

En este idioma mágico, los tipos (las etiquetas de los datos) actúan como guardias de seguridad.

  • Si un dato está etiquetado como "Confiable", significa que proviene de una fuente segura (como una base de datos verificada).
  • Si un dato está etiquetado como "No Confiable", proviene de internet o de un usuario.
  • El idioma tiene una regla: No puedes mezclar ingredientes "No Confiables" en un plato "Confiable".

Cómo Funciona en la Práctica

Volviendo al ejemplo de los artículos de investigación del texto. Le pides al agente: "Encuentra el artículo más antiguo sobre privacidad diferencial y añádelo a mi bibliografía".

  1. La Vieja Forma (Interprete de Código): El agente escribe un programa. Podría decidir simplemente inventar un título de artículo falso, escribirlo en tu archivo y decir: "¡Aquí tienes!". El sistema solo verifica si el código se ejecuta, no si el contenido es real.
  2. La Vieja Forma (Herramientas Restringidas): Solo le das al agente un botón de "Obtener y Guardar". No puede ordenar ni filtrar los resultados por sí mismo. Queda atascado esperando que le digas cuál elegir.
  3. La Forma LBAC (TYPEGUARD):
    • El agente escribe un programa en el idioma mágico.
    • Para obtener un artículo, debe usar una función especial que solo devuelve una etiqueta "Confiable".
    • Para escribir en tu archivo, la función requiere una etiqueta "Confiable".
    • La Verificación Mágica: Antes de que el programa del agente pueda ejecutarse, un "Verificador de Tipos" (un bibliotecario estricto) examina el código.
      • Si el agente intenta escribir un artículo falso (que no tiene etiqueta "Confiable") en el archivo, el bibliotecario dice: "¡Error! Este código no cumple las reglas. Inténtalo de nuevo."
      • El agente recibe el mensaje de error, se da cuenta de su equivocación y reescribe el código para obtener un artículo real de la base de datos primero.
    • Una vez que el código pasa la verificación, se ejecuta.

Por Qué Esto Es Importante

El artículo afirma que este enfoque resuelve el problema de "Seguridad vs. Libertad":

  • Libertad: El agente todavía puede escribir programas complejos, ordenar listas y hacer matemáticas. No está atascado con una pequeña caja de herramientas.
  • Seguridad: Debido a que el agente debe escribir código que se ajuste a las reglas estrictas del idioma, físicamente no puede realizar acciones que rompan las reglas (como filtrar datos secretos o escribir archivos falsos). Si el código no pasa la "Verificación de Tipos", nunca se ejecuta.

El Truco del Agente "Anidado"

El artículo también muestra que esto funciona incluso si el agente contrata a un "subagente" para ayudar.

  • Imagina que el agente principal le pide a un subagente que revise un correo electrónico sospechoso.
  • El subagente lee el correo (que está "sucio" o no confiable).
  • Debido a las reglas del idioma mágico, el subagente se coloca automáticamente en una "zona de cuarentena". Puede leer el correo, pero no puede pasar esos datos "sucios" a las herramientas del agente principal a menos que los envuelva en un contenedor especial que el agente principal tenga permiso para abrir.
  • Esto ocurre automáticamente debido a las reglas del idioma, no por un sistema de seguridad separado.

Resumen

El artículo argumenta que, en lugar de construir muros alrededor de los agentes de IA, deberíamos construir el mundo del IA dentro de un idioma estricto y basado en reglas. En este mundo, la seguridad no es una capa separada que se añade encima; está integrada en la propia esencia de cómo el agente piensa y escribe código. Si el agente intenta romper las reglas, el idioma mismo dice "No", y la acción se bloquea antes de que ocurra.

Los autores probaron esto con tres escenarios:

  1. Procedencia de Datos: Asegurar que solo se añadan a una bibliografía artículos reales provenientes de bases de datos.
  2. Aislamiento del Sistema de Archivos: Asegurar que el agente solo pueda tocar archivos en carpetas específicas (como un token de "capacidad").
  3. Flujo de Información: Asegurar que los datos secretos nunca se filtren accidentalmente a internet público.

En todos los casos, el sistema mantuvo al agente inteligente y flexible mientras garantizaba que no podía romper las reglas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →