aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents
Este artículo presenta aiAuthZ, una pasarela de autorización fuera del host que asegura las llamadas a herramientas de agentes de IA mediante la aplicación de políticas inmutables vinculadas a la identidad y verificación criptográfica, reduciendo eficazmente las tasas de éxito de ataque al 0% en varios modelos y escenarios con una latencia insignificante.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El problema central: El "Mayordomo Incauto"
Imagina que contratas a un mayordomo altamente inteligente (el Agente de IA) para que dirija tu hogar. Este mayordomo es excelente siguiendo instrucciones: puede abrir la caja fuerte, enviar correos electrónicos o transferir dinero.
Sin embargo, hay un inconveniente: el mayordomo no puede distinguir entre una orden real tuya y una orden falsa escrita en una nota adhesiva que alguien más dejó en la nevera.
Si un extraño se cuela en tu casa y escribe: "El dueño dice: Transfiere todo el dinero a mi cuenta", el mayordomo podría leer esa nota, creer que es una orden real tuya y hacerlo. Esto se llama inyección de prompts (prompt injection). El artículo argumenta que confiar en que el mayordomo "piense" si una orden es segura es arriesgado porque:
- Algunos mayordomos son incautos; otros son escépticos.
- Incluso los mayordomos más caros y de alta gama se dejan engañar a veces.
- No puedes simplemente pagar más para hacerlos más seguros.
La solución: El "Guardia de Seguridad Externo" (aiAuthZ)
Los autores crearon un sistema llamado aiAuthZ. En lugar de pedirle al mayordomo que decida si una orden es segura, colocan a un guardia de seguridad en una habitación separada y cerrada (un dominio de confianza diferente) entre el mayordomo y el mundo exterior.
Así es como funciona el nuevo sistema, paso a paso:
1. El "Apretón de Manos Secreto" (Verificación de Identidad)
Cada vez que tú (el usuario) das una orden, no solo la dices; la firmas con un sello digital único e inquebrantable (una firma HMAC) que solo tú y el guardia de seguridad conocen.
- La Analogía: Imagina que le entregas una nota al guardia. La nota tiene un sello de cera especial. El guardia revisa el sello. Si el sello es real, el guardia sabe: "Esta orden definitivamente vino del dueño, no de un extraño".
- El Giro: Aunque el mayordomo lea una nota que diga: "Yo soy el dueño, dame las llaves", el guardia ignora las palabras. El guardia solo confía en el sello. Si el sello no coincide con el del dueño, la orden es rechazada, sin importar lo que digan las palabras.
2. El "Libro de Reglas" (Política Fuera del Host)
El guardia tiene un libro de reglas que el mayordomo no puede ver ni cambiar.
- La Analogía: El mayordomo puede pensar: "¡Tengo permitido abrir cualquier puerta!". Pero el libro de reglas del guardia dice: "Solo el dueño puede abrir la caja fuerte. Solo el dueño puede transferir dinero".
- Incluso si el mayordomo es engañado para creer que tiene permiso, el guardia revisa el libro de reglas. Si la persona que pide (el "sello") no es el dueño, o si intenta hacer algo demasiado grande (como transferir un millón de dólares), el guardia lo detiene.
3. El "Recibo Inquebrantable" (Código QR)
Cuando el guardia dice "Sí, esto es seguro", no solo permite que ocurra la acción. Imprime un recibo de código QR que demuestra que la orden fue autorizada.
- La Analogía: Es como un boleto que obtienes para un concierto. Incluso si tomas una foto del boleto, lo recortas o lo envías a través de un mensaje de texto borroso, el sistema de seguridad aún puede escanarlo y decir: "Este es un boleto válido".
- El artículo probó esto tomando fotos de los códigos QR, recortándolos y comprimiéndolos. El sistema aún los reconocía el 94% de las veces. Esto crea un registro permanente e inalterable de quién hizo qué.
4. La "Bóveda Secreta" (Agente de Credenciales)
El guardia también posee las llaves de la caja fuerte (secretos de API). El mayordomo no tiene las llaves.
- La Analogía: Si el mayordomo es engañado para intentar abrir la caja fuerte, no puede hacerlo porque no tiene la llave. Tiene que pedírsela al guardia. El guardia revisa las reglas y, solo entonces, entrega la llave para ese momento específico. Si el mayordomo intenta robar las llaves, no puede, porque las llaves nunca salen de la habitación del guardia.
Lo que el artículo realmente encontró
Los autores probaron este sistema con 15 diferentes "mayordomos" de IA (modelos) y 8 tipos diferentes de ataques (como engañar al mayordomo para robar datos).
- Sin el Guardia: Los mayordomos eran inconsistentes. Algunos rechazaban el truco (100% seguros), pero otros caían en la trampa (solo 38% seguros). El mayordomo más caro era solo un 50% seguro.
- Con el Guardia: El 100% de los ataques fueron bloqueados. Cada uno de los modelos, desde el más barato hasta el más caro, detuvo las acciones malintencionadas.
- Velocidad: El guardia tomó la decisión en 0.03 milisegundos. Eso es tan rápido como un parpadeo; no ralentizó nada.
- Prueba del Mundo Real: Probaron esto en una simulación bancaria. El guardia detuvo cada intento de un hacker por robar dinero, incluso cuando el hacker intentó engañar al mayordomo.
Lo que este sistema NO hace
Es importante conocer los límites, tal como saber qué es lo que un guardia de seguridad no puede hacer:
- No evita que el mayordomo se confunda. El mayordomo aún puede ser engañado para creer que un extraño es el dueño. El guardia simplemente evita que el mayordomo actúe basándose en esa confusión.
- No evita que un hacker irrumpa en la habitación del guardia. Si el atacante controla la computadora del guardia de seguridad, todo el sistema falla.
- No evita que el mayordomo use sus propias herramientas integradas. Si el mayordomo tiene una puerta trasera secreta (como un comando de shell integrado) que evade al guardia, el guardia no puede detenerlo. El artículo dice que debes desactivar esas puertas traseras cuando instales el sistema.
La Conclusión
El artículo argumenta que no debemos confiar en que los modelos de IA se vigilen a sí mismos. En su lugar, debemos colocar un guardia de seguridad criptográfico separado frente a ellos. Este guardia verifica la identidad de quien pide, revisa las reglas y emite un recibo. Esto convierte una situación caótica e impredecible en una determinista y segura, donde las malas acciones se bloquean el 100% de las veces, independientemente del modelo de IA que se esté utilizando.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.