← Últimos artículos
🤖 AI

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry es una puerta de enlace de seguridad de código abierto y agnóstica al marco de trabajo que mitiga los riesgos progresivos en agentes LLM autónomos mediante la implementación de un sistema de revisión progresiva de múltiples niveles a través de las fases de admisión de habilidades, invocación, ejecución y post-acción, reduciendo significativamente las tasas de éxito de ataque mientras mantiene un alto rendimiento para tareas legítimas.

Autores originales: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

Publicado 2026-08-24
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras ya no solo responden preguntas, sino que comienzan a hacer cosas por sí mismas. Pueden escribir código, abrir archivos en tu disco duro y enviar mensajes a otros servicios para completar una tarea. Estos se llaman agentes autónomos, y representan un salto de herramientas pasivas a trabajadores activos. Sin embargo, esta nueva capacidad trae consigo un nuevo tipo de peligro. Si un trabajador es engañado para que recoja una herramienta maliciosa, o si se desliza una instrucción oculta en un documento que está leyendo, la computadora puede ser forzada a robar secretos, eliminar datos importantes o extender su influencia a otros sistemas. El riesgo no es solo un error único; es una reacción en cadena donde una sola mala decisión puede conducir a una cascada de daños. El desafío central para los expertos en seguridad es que estos ataques son ingeniosos y cambiantes. Una mala instrucción podría estar oculta en un archivo, disfrazada como una solicitud normal, o dividida en pasos pequeños y de apariencia inofensiva que solo se vuelven peligrosos cuando se combinan.

Investigadores del Laboratorio de Inteligencia Artificial de Shanghái han desarrollado un nuevo sistema para detener estos ataques antes de que causen daño. Lo llaman ClawSentry. En lugar de intentar atrapar cada movimiento malo después de que ocurre, este sistema actúa como un guardián que vigila todo el ciclo de vida del trabajo de un agente informático. Los investigadores se dieron cuenta de que el peligro puede entrar en cuatro etapas diferentes: cuando se introduce por primera vez una nueva herramienta, cuando el agente decide usarla, mientras la herramienta se está ejecutando realmente, y después de que la herramienta ha terminado su trabajo y producido resultados. Los métodos de seguridad anteriores usualmente solo miraban una de estas etapas, como revisar las palabras que un usuario escribe o vigilar el código que una computadora ejecuta. El equipo encontró que esto no era suficiente porque un actor malintencionado podría simplemente intentarlo de nuevo de una manera diferente, usando una herramienta distinta o formulando la solicitud de manera diferente, para evadir un único punto de control.

Para resolver esto, los investigadores construyeron un marco que se sitúa entre el agente informático y el mundo exterior, vigilando todo lo que el agente intenta hacer. Diseñaron un sistema que funciona en capas, muy parecido a un equipo de seguridad que primero verifica la identificación de un visitante, luego observa su comportamiento y, finalmente, revisa el resultado de su visita. La primera línea de defensa ocurre antes de que se use una nueva herramienta. El sistema lee el paquete completo de código de esa herramienta para buscar peligros ocultos. Si el código parece sospechoso, la herramienta es bloqueada inmediatamente. Esto evita que el agente cargue un programa peligroso en primer lugar. Si una herramienta pasa este control inicial, el sistema entonces vigila cada acción que el agente realiza. Utiliza un conjunto de reglas simples y rápidas para detectar peligros obvios, como intentar eliminar un archivo crítico del sistema. Si la acción no es claramente peligrosa pero tampoco es claramente segura, el sistema escala la decisión a un modelo informático más avanzado que puede entender el contexto y la intención detrás de la solicitud.

Una parte crucial de este sistema es su capacidad para recordar lo que ya ha bloqueado. Si un agente intenta robar un archivo y es detenido, el sistema registra ese objetivo específico. Si el agente lo intenta de nuevo más tarde usando una herramienta diferente o dividiendo la solicitud en pasos más pequeños, el sistema reconoce que es el mismo objetivo malicioso con un nuevo disfraz y lo detiene nuevamente. Esto evita que el agente desgaste las defensas intentando muchos enfoques diferentes. El sistema también vigila lo que sucede después de que se completa una acción. A veces, el peligro solo aparece en los resultados que devuelve una herramienta, como un archivo que contiene instrucciones ocultas para el siguiente paso. El sistema revisa estos resultados y puede alertar a un operador humano si algo salió mal, permitiéndole detener el proceso antes de que se produzcan más daños.

Los investigadores probaron este sistema con varios tipos diferentes de agentes informáticos y encontraron que es altamente efectivo. En pruebas donde los agentes fueron expuestos a una amplia variedad de herramientas peligrosas e instrucciones ocultas, el sistema redujo la tasa de ataques exitosos de casi la mitad de todos los intentos a una fracción muy pequeña. Específicamente, en un conjunto estándar de pruebas de seguridad, el sistema redujo la tasa de éxito de los ataques de un rango del 33.5% al 49.7% a entre el 9.09% y el 15.03%. Al mismo tiempo, el sistema no detuvo el trabajo normal y útil de los agentes. Cuando los agentes recibieron tareas seguras, pudieron completarlas exitosamente casi siempre, con una tasa de éxito del 98.7%. Esto demuestra que el sistema puede distinguir entre un error genuino y un ataque malicioso sin interferir con el trabajo útil.

El estudio también exploró cómo el sistema maneja diferentes tipos de modelos informáticos y encontró que su protección funciona independientemente de qué inteligencia artificial específica esté realizando el pensamiento. Las reglas de seguridad y el proceso de control están separados del agente en sí, lo que significa que el mismo sistema de seguridad puede proteger muchos tipos diferentes de agentes. Los investigadores también descubrieron que la forma más efectiva de detener un ataque es bloquear la herramienta peligrosa antes de que el agente tenga la oportunidad de usarla. Una vez que una mala herramienta se carga en la memoria del agente, se vuelve mucho más difícil detener el daño, incluso si el sistema es muy bueno detectando malas acciones más adelante. Esto sugiere que la mejor defensa es ser estricto sobre qué herramientas se permiten en el sistema en primer lugar.

Al combinar un control inicial estricto, una revisión de múltiples capas de cada acción y una memoria de intentos pasados, este nuevo sistema crea un entorno mucho más seguro para las computadoras autónomas. Aborda la realidad de que los ataques no son eventos aislados, sino intentos continuos de encontrar una vía de entrada. Los resultados sugieren que, con la supervisión adecuada, podemos permitir que las computadoras asuman tareas complejas sin ceder el control a actores malintencionados. El sistema no depende de un truco único o de un modelo perfecto; en cambio, utiliza un enfoque estructurado que atrapa las amenazas en múltiples puntos, asegurando que incluso si una capa es evadida, otra esté lista para detener el peligro. Este trabajo proporciona un plano práctico de cómo podemos integrar de manera segura agentes informáticos poderosos e independientes en nuestras vidas diarias y entornos laborales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →