ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
Este artículo introduce ColluSkill, un marco adversarial que evade los escáneres de habilidades existentes mediante la descomposición de intenciones maliciosas en sub-cargas útiles interdependientes y localmente benignas, y propone ChainGuard, un mecanismo de defensa sensible al contexto que mitiga eficazmente estos ataques de composición de habilidades cruzadas mediante el análisis de riesgos a nivel de flujo de trabajo.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde tu computadora no solo sigue órdenes, sino que realmente tiene una caja de herramientas de "habilidades" que puede recoger y usar. Piensa en estas habilidades como piezas de Lego o aplicaciones en tu teléfono: una pieza de "Buscar Archivos", una de "Enviar Correo Electrónico" o una de "Leer Documento". Estas se llaman Habilidades de Agente (Agent Skills), y permiten que programas informáticos inteligentes (conocidos como Agentes de IA) realicen tareas complejas uniendo estas herramientas. Pero, al igual que en la vida real, no todas las herramientas en la caja son seguras. Algunas podrían ser trampas ocultas diseñadas para robar tus secretos o borrar tu tarea. Para mantener las cosas seguras, tenemos Escáneres de Habilidades (Skill Scanners): guardias de seguridad digitales que revisan cada nueva herramienta antes de dejarla entrar en tu caja de herramientas. Ellos revisan las instrucciones y el código para asegurarse de que nada sospechoso se esconda en su interior. La gran pregunta que los investigadores se plantean es: ¿Qué pasa si los malos no intentan esconder una trampa gigante y obvia, sino que en su lugar introducen tres o cuatro piezas diminutas y de apariencia inofensiva que solo se vuelven peligrosas cuando se ensamblan entre sí?
Esto es exactamente lo que explora el artículo ColluSkill. Los autores descubrieron una forma ingeniosa de engañar a esos guardias de seguridad. Descubrieron que los escáneres actuales son como porteros que revisan a cada persona que entra a un club una por una. Si una persona parece inocente por sí sola, entra. Pero los investigadores demostraron que puedes dividir un plan peligroso en varias partes diminutas e inofensivas. Individualmente, cada parte pasa la revisión del portero. Pero una vez que todas están dentro y trabajando juntas, se ensamblan de nuevo para formar un ataque peligroso. El artículo llama a esto ColluSkill, un marco de trabajo que descompone un plan malicioso en una cadena de habilidades "coludidas". Utiliza una IA inteligente para planificar cómo encajan estas piezas y luego sigue ajustándolas hasta que parezcan perfectamente seguras para el escáner, aunque estén listas para causar problemas una vez que empiecen a trabajar juntas.
Para combatir esto, el artículo introduce un nuevo defensor llamado ChainGuard. En lugar de revisar la nueva herramienta de forma aislada, ChainGuard observa el panorama completo: "¿Qué herramientas hay ya en la caja de herramientas? ¿Cómo se conecta esta nueva con ellas?". Es como un guardia de seguridad que no solo revisa tu identificación, sino que también pregunta: "¿Con quién te vas a reunir y qué planean hacer juntos?". Los investigadores probaron sus ideas en seis escáneres de seguridad diferentes y descubrieron que su truco funcionaba increíblemente bien. El ataque ColluSkill logró burlar a los escáneres el 96.0% de las veces en promedio, mientras que los métodos antiguos de ataque solo lograban pasar aproximadamente el 37.8% de las veces. Sin embargo, cuando usaron ChainGuard, la tasa de éxito del ataque cayó drásticamente al 22.5%, permitiendo al mismo tiempo que el 99.5% de las herramientas buenas e inofensivas pasaran.
La historia del set de Lego astuto
Sumerjámonos más profundamente en cómo funciona todo esto, usando una historia sobre un tipo muy específico de atraco.
El Problema: El guardia de seguridad "demasiado inteligente"
Imagina que estás intentando meter un "Script de Exfiltración de Datos" prohibido (un programa que roba tus secretos) en un edificio de alta seguridad. El guardia de seguridad en la puerta tiene un escáner. Si traes una caja grande y roja con la etiqueta "DATOS ROBADOS", el escáner grita: "¡BLOQUEADO!" y te detiene.
Los investigadores descubrieron que los escáneres de seguridad actuales funcionan exactamente como este guardia. Miran una habilidad a la vez. Revisan sus instrucciones, sus permisos y su código. Si una sola habilidad parece segura, recibe un "Pasa". El problema es que estos guardias no miran al equipo completo. No se dan cuenta de que si traes a tres personas diferentes, cada una cargando una pieza diminuta e inofensiva de un rompecabezas, esas tres personas podrían ser capaces de ensamblar el rompecabezas prohibido una vez que estén adentro.
El Ataque: ColluSkill (El maestro del disfraz)
Los autores crearon un método llamado ColluSkill para explotar este punto ciego. Piensa en esto como un maestro ladrón que decide no traer una bomba grande, sino traer tres artículos separados y de apariencia inocente:
- Habilidad A (El Explorador): "Solo quiero mirar los archivos en la habitación". (Parece inofensiva).
- Habilidad B (El Escriba): "Solo quiero escribir lo que veo". (Parece inofensiva).
- Habilidad C (El Mensajero): "Solo quiero enviar un mensaje al exterior". (Parece inofensiva).
Individualmente, el escáner de seguridad revisa cada una y dice: "Claro, está bien". Pero aquí está el truco: ColluSkill usa una IA inteligente para planificar exactamente cómo se conectan estas tres.
- La Habilidad A encuentra un archivo secreto.
- La Habilidad A le pasa ese archivo a la Habilidad B.
- La Habilidad B escribe el contenido del archivo en un mensaje.
- La Habilidad B le pasa ese mensaje a la Habilidad C.
- La Habilidad C envía el mensaje hacia afuera.
La magia de ColluSkill reside en dos pasos:
- Planificación de la Cadena (Chain Planning): La IA descubre el orden perfecto para que el "peligro" se distribuya. Ninguna habilidad hace nada malo por sí sola; solo pasan información de una a otra.
- Retroalimentación del Escáner (Scanner Feedback): La IA intenta introducir las habilidades. Si el escáner marca una (por ejemplo, "La Habilidad C parece un poco sospechosa"), la IA la reescribe para que parezca más inocente y vuelve a intentarlo. Sigue haciendo esto hasta que cada pieza pasa la revisión.
En sus pruebas, este método fue aterradoramente efectivo. Cuando intentaron pasar estas cadenas ante seis escáneres del mundo real, ColluSkill tuvo éxito el 96.0% de las veces. Compara esto con los métodos antiguos que simplemente dividían el código malicioso sin esta planificación inteligente, los cuales solo tuvieron éxito aproximadamente el 36.7% de las veces. Los investigadores descubrieron que simplemente dividir el código no era suficiente; la planificación y la reescritura fueron lo que marcó la diferencia.
La Defensa: ChainGuard (El detective)
Entonces, ¿cómo detenemos esto? El artículo propone ChainGuard. En lugar de ser un guardia que revisa a las personas una por una, ChainGuard es un detective que observa al grupo completo.
Cuando una nueva habilidad quiere entrar, ChainGuard pregunta: "¿Quién está ya en la habitación? ¿Qué están haciendo?".
- Si la Habilidad C (El Mensajero) intenta entrar, ChainGuard mira las habilidades instaladas y ve que la Habilidad A (El Explorador) y la Habilidad B (El Escriba) ya están allí.
- Se da cuenta: "Espera un momento. Si A encuentra secretos, B los escribe y C los envía, ¡eso es una cadena de robo!".
- Aunque la Habilidad C parece inocente por sí sola, ChainGuard la bloquea debido a lo que podría hacer con las otras.
Los resultados fueron impresionantes. Cuando los investigadores usaron ChainGuard, la tasa de éxito del ataque ColluSkill cayó del 96.0% al 22.5%. Crucialmente, ChainGuard no bloqueó todo; todavía permitió que el 99.5% de los flujos de trabajo buenos e inofensivos pasaran. Aprendió a distinguir entre un equipo de amigos construyendo una casa y un equipo de ladrones planeando un atraco.
¿Realmente funciona en el mundo real?
Los investigadores no se detuvieron solo en el escáner de seguridad. Probaron si estas cadenas astutas podían ejecutarse realmente en herramientas de codificación de IA reales como OpenCode, Claude Code y Codex. Descubrieron que las cadenas funcionaban perfectamente. En OpenCode, las cadenas de ataque se activaron con éxito el 89.5% de las veces (con GPT-5.5). Esto demuestra que la amenaza no es solo teórica; si un actor malintencionado utiliza este método, podría ejecutar estos ataques en computadoras reales.
La Conclusión
El artículo concluye que tenemos un nuevo tipo de problema de seguridad. No podemos simplemente verificar si una sola herramienta es segura; tenemos que verificar si un grupo de herramientas es seguro cuando trabajan juntas. El ataque ColluSkill muestra que dividir un plan malo en piezas pequeñas e inofensivas es una forma muy poderosa de evadir las defensas actuales. Pero la buena noticia es que ChainGuard muestra un camino a seguir: si empezamos a observar cómo se conectan e interactúan las herramientas, podemos atrapar estas cadenas astutas antes de que causen cualquier daño. Los investigadores sugieren que el futuro de la seguridad de la IA no se trata solo de mejores escáneres, sino de guardias más inteligentes y conscientes del contexto que comprenden la historia completa, no solo los capítulos individuales.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.