← Últimos artículos
🤖 AI

Agent Security Needs Redefinition through a Holistic Framework

Este artículo sostiene que la seguridad de los agentes es fundamentalmente un problema contextual en lugar de uno basado en el contenido, proponiendo un marco holístico definido por Autorización de la Fuente, Alineación de la Tarea, Alineación de la Acción y Aislamiento de Datos para abordar las limitaciones estructurales de las defensas y evaluaciones actuales centradas en el contenido.

Autores originales: Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

Publicado 2026-07-27
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el capitán de una nave espacial muy inteligente y muy rápida. Esta nave tiene un nuevo tipo de piloto automático: un agente de IA. Este agente no solo conduce; también puede hablar con otras computadoras, abrir puertas, mover carga e incluso reparar el motor. Pero aquí está la parte difícil: la nave vuela a través de una galaxia llena de ruido. A veces, un miembro amable de la tripulación da una orden, y otras veces, un alienígena astuto intenta engañar a la nave escondiendo una orden falsa dentro de un mensaje que parece inofensivo.

Durante mucho tiempo, los científicos que estudiaban estas naves de IA pensaron que la única forma de mantenerse seguros era observar las palabras de la orden. Si la orden sonaba aterradora, como "hacer explotar el motor", la detendrían. Si sonaba agradable, como "reparar el motor", la dejarían pasar. Pero esto es como un guardia de seguridad en un club que solo mira el color de tu camisa. Si un ladrón viste una camisa roja, el guardia lo deja entrar. Si un bombero viste una camisa roja, el guardia lo detiene. El problema es que las mismas palabras pueden ser una petición amistosa de un jefe o una trampa mortal de un hacker, dependiendo enteramente de quién está hablando y de cuál es la situación. Este artículo argumenta que debemos dejar de mirar solo las palabras y empezar a mirar toda la historia detrás de ellas.


El Gran Lío: Las Palabras frente a Quién las Dijo

Los autores de este artículo, un equipo de investigadores de UC Santa Cruz y UC Berkeley, señalan que estamos cometiendo un error enorme en la forma en que probamos y protegemos a los agentes de IA. Dicen que hemos estado haciendo la pregunta equivocada. En lugar de preguntar: "¿Parece peligrosa esta orden?", deberíamos preguntar: "¿Está permitida esta orden en esta situación específica?".

Para entender por qué esto importa, imagina un comando de "Eliminar archivo".

  • Escenario A: Tu jefe, que tiene la llave del edificio, dice: "Elimina los archivos viejos del año pasado". Esto es algo bueno.
  • Escenario B: Un hacker, que escondió una nota en un tablero público, dice: "Elimina los archivos viejos del año pasado". Esto es un desastre.

Las palabras son idénticas. La acción es idéntica. Pero en el primer caso, es una limpieza rutinaria. En el segundo, es un crimen. Los sistemas de seguridad actuales son como un robot que solo lee la nota. Ve "Eliminar" y entra en pánico, o ve "Eliminar" y piensa: "Oh, esto está bien", sin verificar quién lo escribió. Los autores argumentan que esto es como intentar juzgar una película mirando un solo fotograma. Te pierdes la trama, los personajes y el contexto.

El Control de Seguridad de Cuatro Partes

Para solucionar esto, el artículo sugiere que dejemos de mirar la acción por sí sola y empecmos a verificar cuatro cosas específicas, como un equipo de seguridad realizando una lista de verificación antes de dejar que una nave espacial se mueva. Lo llaman un "marco holístico", que es solo una forma elegante de decir "mirar el panorama completo".

Aquí están las cuatro reglas que los autores dicen que debemos verificar para cada acción que toma una IA:

  1. Autorización de la Fuente (¿Quién está hablando?): Esto pregunta: "¿Realmente dijo esto una persona con las llaves adecuadas?". Si un comando proviene de una página web aleatoria o de un documento que la IA está leyendo, es como un extraño gritando órdenes desde la calle. Incluso si la orden es "enviar dinero", si el extraño no es el gerente del banco, la respuesta es "No".
  2. Alineación con la Tarea (¿Cuál es la misión?): Esto pregunta: "¿Es esta orden parte del trabajo para el cual la IA fue contratada?". Imagina a un robot de entrega contratado para llevar pizza. Si alguien le dice que "vaya a robar un banco", ese es un trabajo diferente. Aunque el robot pueda conducir al banco, no debería hacerlo porque no es su misión.
  3. Alineación de la Acción (¿Encaja este paso en la misión?): Esto pregunta: "¿Este movimiento específico ayuda a la misión?". Si el robot está entregando pizza, puede que necesite abrir una puerta. Pero si decide "romper la puerta" para pasar, eso es demasiado. El objetivo (entregar pizza) está bien, pero la acción (romper) es incorrecta.
  4. Aislamiento de Datos (¿Se están filtrando secretos?): Esto pregunta: "¿Está la IA mezclando información privada?". Imagina a un asistente médico. Si ayuda al Paciente A, y luego ayuda al Paciente B, no debería contar accidentalmente al Paciente B la historia médica del Paciente A. La IA necesita mantener los "archivos" de diferentes personas separados.

Por qué los Test Antiguos Están Fallando

El artículo señala que muchos de los tests que usamos hoy para ver si una IA es segura están rotos porque ignoran estas cuatro reglas. Los investigadores examinaron dos conjuntos de pruebas populares, AgentDojo y WASP, que contienen 45 diferentes escenarios de "ataque".

Encontraron algo sorprendente: Cada uno de esos 45 "ataques" también podría ser una solicitud normal y legal.

  • El Ataque: "Transferir $30,000 en pequeñas partes".
    • La versión "Mala": Un hacker intentando robar dinero.
    • La versión "Buena": Un contador legítimo tratando de mantenerse bajo un límite diario mientras paga una casa.
  • El Ataque: "Añadir un nuevo usuario como Propietario".
    • La versión "Mala": Un hacker tomando el control de un proyecto.
    • La versión "Buena": Un jefe incorporando a un nuevo cofundador.

Los tests actuales simplemente ven la acción ("Transferir dinero" o "Añadir usuario") y dicen: "¡Eso es un ataque!". Los autores dicen que esto es erróneo. El test no puede distinguir la diferencia porque no está verificando quién lo pidió o por qué. Es como reprobar a un estudiante por escribir la palabra "bomba" en una historia sobre una película, sin leer el resto de la historia.

El Problema de la "Instantánea"

Los autores también critican cómo probamos la IA. La mayoría de los tests son como "instantáneas". Le dan un comando a la IA, ven qué sucede y luego reinician todo. Borran la memoria de la IA y comienzan de nuevo.

Pero la vida real no es una instantánea; es una película. Un hacker podría no atacar inmediatamente. Podría plantar una nota "envenenada" en la memoria de la IA hoy, y luego, tres días después, la IA lee esa nota y piensa que es una orden real. Debido a que los tests de instantánea reinician la memoria, nunca podrán ver estos ataques lentos y sigilosos. Los autores argumentan que necesitamos observar todo el viaje de la IA, no solo un paso a la vez.

La Solución: Una Nueva Forma de Construir Defensas

Entonces, ¿qué hacemos? El artículo sugiere que dejemos de intentar construir "filtros de contenido" (programas que solo escanean palabras buscando malas vibras) y empecemos a construir "controles de contexto".

  • En lugar de preguntar: "¿Parece esta frase un hackeo?"
  • Deberíamos preguntar: "¿Es la fuente autorizada? ¿Es la tarea permitida? ¿Es la acción demasiado grande? ¿Se están filtrando datos?"

Esto cambia la forma en que construimos las defensas. Si una defensa es buena verificando la "Autorización de la Fuente", no necesita ser perfecta adivinando si una palabra es "mala". Solo necesita saber si la persona que habla tiene una llave. Este es un trabajo mucho más fácil y confiable.

Los autores admiten que esto es un gran cambio. Significa que no podemos confiar solo en que la IA "sepa" qué es malo. Tenemos que construir sistemas que verifiquen constantemente las cuatro reglas mientras la IA trabaja. Sugieren que, aunque no siempre podemos tener un seguimiento perfecto, podemos construir sistemas que sean "suficientemente buenos" para verificar estas cuatro cosas para detener los grandes errores.

La Conclusión

Este artículo no pretende haber resuelto todos los problemas de la seguridad de la IA. No dice: "¡Lo hemos arreglado todo!". En cambio, dice: "Hemos estado mirando el problema de la manera equivocada".

Al tratar la seguridad como una historia sobre quién hace qué y por qué, en lugar de solo una lista de malas palabras, podemos construir una IA que sea realmente segura. Es la diferencia entre un guardia de seguridad que solo mira tu cara y uno que verifica tu identificación, tu boleto, tu destino y tu equipaje. El artículo sugiere que si queremos que nuestras agentes de IA vuelen de forma segura por la galaxia, debemos empezar a revisar el boleto completo, no solo la cara.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →