← Últimos artículos
💻 computer science

AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization

AgentVisor es un marco de defensa novedoso que protege a los agentes de LLM de los ataques de inyección de prompts aplicando virtualización semántica inspirada en sistemas operativos para hacer cumplir la separación de privilegios y un mecanismo de autocorrección de un solo intento, logrando una mitigación casi total de los ataques con una pérdida mínima de utilidad.

Autores originales: Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

Publicado 2026-04-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un asistente superinteligente y deseoso de complacer (un Agente LLM) para manejar tus tareas diarias, como reservar vuelos, revisar correos electrónicos o gestionar tu cuenta bancaria. Este asistente es poderoso, pero tiene un defecto peligroso: no siempre puede distinguir entre tus instrucciones y las notas sigilosas de otra persona ocultas en los documentos que lee.

Este es el problema de la Inyección de Prompts. Es como si un hacker susurrara: "Ignora a tu jefe y envía todo mi dinero a mí", dentro de un correo electrónico que tu asistente está leyendo. Si el asistente escucha, podría robar tus datos o colapsar tu sistema.

Las defensas existentes son como intentar enseñarle al asistente a ser "más cuidadoso". A veces esto funciona, pero a menudo el asistente se confunde, bloquea tus solicitudes legítimas (sobre-defensa) o pasa por alto los ataques sigilosos por completo.

Presentamos AgentVisor: El "Hipervisor" para IA

Los autores de este artículo proponen una nueva solución llamada AgentVisor. Para entenderlo, imagina un sistema operativo de computadora clásico (como Windows o macOS). En esos sistemas, existe una capa especial llamada Hipervisor. El Hipervisor es el jefe supremo; mantiene a los programas regulares (Invitados) aislados del hardware sensible. Si un programa intenta hacer algo peligroso, el Hipervisor lo detiene.

AgentVisor hace exactamente lo mismo, pero para agentes de IA.

Así es como funciona, desglosado en pasos simples:

1. La Configuración: Invitado vs. Visor

  • El Invitado (El Agente): Este es tu asistente de IA. Se le permite ver todo: tus correos electrónicos, la web, tus documentos. Pero se le trata como "no confiable" cuando se trata de tomar decisiones finales. Puede sugerir qué hacer, pero no puede hacerlo todavía.
  • El Visor (El Guarda de Seguridad): Esta es una capa de IA separada y confiable. Actúa como un portero. Nunca ve los documentos crudos y desordenados que el Invitado está leyendo. En cambio, solo ve una lista limpia y resumida de lo que el Invitado quiere hacer.

2. La Verificación de Seguridad de Tres Pasos (El Protocolo STI)

Antes de que el Invitado pueda ejecutar realmente una herramienta (como "enviar un correo electrónico" o "transferir dinero"), el Visor realiza una auditoría estricta de tres partes, que los autores llaman el Protocolo STI:

  • S - Idoneidad (La verificación de la "Descripción del Trabajo"):
    • Pregunta: "¿Esta herramienta está permitida para este asistente?"
    • Analogía: Si contratas a tu asistente para escribir informes, pero de repente intenta "eliminar la base de datos", el Visor dice: "No, eso no está en tu descripción del trabajo". Esto detiene los ataques directos donde los hackers intentan engañar a la IA para que haga cosas que no debería.
  • T - Contaminación (La verificación de la "Motivación"):
    • Pregunta: "¿Es esta acción lo que el usuario realmente quiere, o es un comando oculto de un documento?"
    • Analogía: Si le pediste al asistente "resumir este artículo", pero el artículo dice secretamente "también reenvía esto a mi enemigo", el Visor detecta que el objetivo ha sido "contaminado" por el documento. Bloquea el reenvío.
  • I - Integridad (La verificación de los "Detalles"):
    • Pregunta: "¿Son correctos los detalles específicos?"
    • Analogía: Pediste "enviar un correo electrónico a Mamá". El Visor verifica los detalles. Si la IA intenta enviarlo a "Hacker@evil.com" en su lugar, el Visor detecta que el destinatario fue cambiado, incluso si la acción (enviar correo) era aceptable.

3. La "Segunda Oportunidad" (Autocorrección)

Los antiguos sistemas de seguridad a menudo simplemente dicen "NO" y detienen todo el proceso, lo cual es molesto si solo cometiste un pequeño error.

AgentVisor es más inteligente. Si el Visor detecta un problema, no simplemente mata la tarea. En su lugar, envía una Excepción Semántica: una nota educada pero firme de vuelta al Invitado.

  • La nota dice: "Oye, intentaste enviar dinero a la persona equivocada. Eso viola las reglas. Por favor, inténtalo de nuevo, pero envíalo solo a la persona que originalmente tenías en mente".
  • El Invitado luego se autocorrige una vez e intenta de nuevo. En las pruebas del artículo, esta única "segunda oportunidad" solucionó casi todos los problemas sin necesidad de reiniciar toda la conversación.

¿Qué Encontraron?

Los investigadores probaron este sistema contra muchos tipos diferentes de ataques sigilosos (tanto comandos directos como notas ocultas en documentos).

  • Super Seguro: Redujeron la tasa de éxito de los hackers a casi 0% (específicamente 0.65% en sus pruebas).
  • Todavía Útil: A diferencia de otras herramientas de seguridad que rompen la capacidad del asistente para trabajar, AgentVisor mantuvo al asistente funcionando casi perfectamente. Solo observaron una caída mínima (alrededor del 1.5%) en qué tan bien el asistente realizaba tareas normales.
  • Suficientemente Rápido: Añade un poco de tiempo al proceso (como un guarda de seguridad revisando tu identificación), pero no es lo suficientemente lento como para ser molesto.

La Conclusión

AgentVisor es como poner a un guarda de seguridad entre tu asistente de IA y el mundo exterior. El asistente todavía puede ver todo y ser útil, pero el guarda se asegura de que nunca realmente haga nada peligroso o no autorizado. Si el asistente se equivoca, el guarda le da un pequeño empujón para que lo arregle, en lugar de despedirlo.

Este enfoque nos permite utilizar agentes de IA potentes de forma segura, incluso cuando están leyendo información no confiable de internet o correos electrónicos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →