← Últimos artículos
💻 computer science

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

Este artículo presenta SkillSec-Eval, un marco integral que identifica y evalúa vulnerabilidades de seguridad a lo largo de todo el ciclo de vida de las habilidades reutilizables de agentes de Modelos de Lenguaje Grande, demostrando que los riesgos se extienden significativamente más allá de las preocupaciones tradicionales de ejecución en tiempo de ejecución.

Autores originales: Sanket Badhe, Priyanka Tiwari

Publicado 2026-07-16
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Sanket Badhe, Priyanka Tiwari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde tu computadora no solo sigue órdenes, sino que realmente sale y hace cosas por ti. Este es el reino de los Agentes de IA: programas inteligentes que pueden planificar pasos, usar herramientas como un navegador web o un sistema de archivos, y resolver problemas complejos por sí mismos. Para que estos agentes sean superpoderosos, los desarrolladores han comenzado a construirlos a partir de "habilidades". Piensa en estas habilidades como piezas de LEGO o recetas prefabricadas. En lugar de enseñarle a la IA cómo hornear un pastel desde cero cada vez, le das una "Habilidad de Repostería" que puede tomar de un estante digital y usar cuando sea necesario. Estas habilidades son reutilizables, lo que significa que una sola habilidad puede ser compartida por miles de agentes de IA diferentes.

Pero aquí está el truco: al igual que una biblioteca física puede llenarse de libros que han sido manipulados, una biblioteca digital de habilidades de IA puede ser peligrosa. Si un actor malintencionado infiltra una habilidad "envenenada" en la biblioteca, la IA podría tomarla, pensar que es segura porque se ve bien por fuera, y luego accidentalmente borrar tus archivos o robar tus contraseñas. Durante mucho tiempo, los científicos solo se preocuparon por si se engañaba a la IA con las palabras que le escribías (como un hechizo mágico que sale mal). Pero esta nueva investigación sugiere que el verdadero peligro no es solo lo que le dices a la IA, sino lo que la IA recoge del mundo que la rodea.


El artículo: "Agent Skill Security"

Este artículo, titulado "Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation", es como una historia de detectives sobre cómo estos ladrillos digitales de LEGO pueden ser hackeados. Los autores se dieron cuenta de que, mientras todos vigilaban la boca de la IA (lo que dice), estaban ignorando las manos de la IA (lo que recoge y hace). Construyeron un nuevo marco de prueba llamado SkillSec-Eval para observar toda la vida de una habilidad, desde el momento en que se crea hasta el momento en que se actualiza años después.

Las seis etapas de la vida de una habilidad

Los autores dividen la vida de una habilidad en seis etapas distintas, como una carrera de relevos donde el testigo es pasado de un corredor al siguiente. Si el testigo es cambiado por uno falso en cualquier punto, toda la carrera se arruina.

  1. Autoría (La Creación): Esto es cuando un desarrollador escribe la habilidad. El peligro aquí es que el creador pueda ser astuto, ocultando instrucciones maliciosas dentro de una habilidad que parece útil en la superficie.
  2. Almacenamiento (La Biblioteca): Una vez escrita, la habilidad va a un repositorio digital (una biblioteca). Los atacantes pueden infiltrarse aquí, intercambiar una habilidad segura por una mala, o engañar a la biblioteca para que acepte una versión falsa de una antigua y segura habilidad.
  3. Recuperación (La Búsqueda): Cuando una IA necesita hacer algo, busca en la biblioteca. Los atacantes pueden "rellenar" sus malas habilidades con palabras clave populares para que el motor de búsqueda piense que son el resultado más relevante, empujándolas al principio de la lista.
  4. Selección (La Elección): El "cerebro" de la IA (el planificador) observa los primeros resultados de búsqueda y elige uno. Los atacantes pueden escribir reseñas falsas o descripciones engañosas para engañar a la IA para que elija la mala habilidad en lugar de una buena.
  5. Ejecución (La Acción): La IA realmente ejecuta la habilidad. Incluso si la habilidad fue elegida correctamente, podría intentar hacer algo que no tiene permitido, como abrir una puerta que no debería.
  6. Evolución (La Actualización): Las habilidades se actualizan con el tiempo. Un atacante puede esperar hasta que una habilidad sea confiable y popular, y luego infiltrar un virus en una actualización de la "versión 2.0".

El gran descubrimiento: No es solo una cosa

Los investigadores probaron 327 habilidades del mundo real y descubrieron que las vulnerabilidades existen en cada una de las etapas. No solo encontraron un tipo de hackeo; encontraron todo un ecosistema de ellos.

  • La biblioteca tiene fugas: Descubrieron que las reglas simples (como verificar si un archivo tiene una firma válida) no son suficientes. Los actores malintencionados pueden crear habilidades que parecen perfectas en el papel pero tienen instrucciones maliciosas ocultas. Cuando usaron una IA inteligente para revisar el significado del código, detectaron muchas más habilidades malas, pero incluso así, algunas se filtraron.
  • La búsqueda está amañada: En sus pruebas, los atacantes usaron "Relleno de Palabras Clave" (añadir toneladas de palabras populares a una mala habilidad) y "Ataques Sybil" (crear 15 copias falsas de la misma mala habilidad). Sin un filtro especial, estas malas habilidades dominaron los resultados de búsqueda. Por ejemplo, en una prueba, el 93.20% de las veces, una mala habilidad aparecía en los 5 primeros resultados cuando no se usaba ninguna defensa. Con su nueva defensa, lograron bajar ese número, pero no fue perfecto.
  • La IA es fácilmente engañada: Cuando la IA tenía que elegir una habilidad basada en una descripción, era fácilmente engañada por insignias de "Oficial" falsas o texto engañoso. En una prueba, el 45.64% de las veces, la IA eligió una mala habilidad solo porque tenía una recomendación falsa adjunta.
  • La acción es peligrosa: Una vez que una mala habilidad se está ejecutando, puede intentar robar datos. Los investigadores descubrieron que sin un guardián en tiempo de ejecución, el 100% de sus ataques de prueba lograron alcanzar su objetivo. Sin embargo, incluso con un guardián, encontraron un truco difícil: si la IA reescribe los datos robados con sus propias palabras (parafraseo) antes de enviarlos, el guardián a veces no lo detecta.

Los números cuentan la historia

El artículo proporciona cifras concretas para mostrar lo difícil que es este problema:

  • Admisión en el repositorio: Cuando combinaron reglas simples con una verificación de IA inteligente, redujeron el número de habilidades malas que entran en la biblioteca al 7.9%. Sin embargo, esto también rechazó accidentalmente el 20.0% de las habilidades buenas, mostrando que ser demasiado estricto dificulta el trabajo de los desarrolladores reales.
  • Recuperación: Para los "Ataques Sybil" (clones falsos), el número de malas habilidades en los primeros resultados cayó de un promedio de 2.84 a 0.27 con su nueva defensa.
  • Engaño del Planificador: Cuando las malas habilidades tenían recomendaciones falsas, la IA las eligió el 45.64% de las veces. Con su defensa, esto cayó al 8.72%.
  • Tiempo de ejecución: Incluso con un monitor de tiempo de ejecución fuerte, el 23.0% de los ataques todavía tuvieron éxito porque la IA logró ocultar el robo de datos dentro de su propio proceso de pensamiento.

Lo que no saben (y lo que descartan)

Los autores son muy claros sobre lo que no encontraron. No encontraron una "solución mágica" que lo resuelva todo. Excluyen explícicamente la idea de que solo revisar la estructura del código (como buscar una firma) es suficiente; es necesario entender también el significado. También muestran que ninguna defensa única funciona por sí sola. Si solo proteges la biblioteca, el hacker puede engañar la búsqueda. Si solo proteges la búsqueda, el hacker puede engañar la elección de la IA.

También admiten que su estudio tiene límites. Probaron en un entorno controlado con 327 habilidades, no en todo el internet. No probaron ataques que ocurren a lo largo de muchos años (decadencia de confianza a largo plazo) ni ataques que intentan romper el cerebro de la IA directamente (jailbreaking). Sugieren que, si bien su marco es un gran paso adelante, el problema de mantener seguros estos ladrillos digitales de LEGO sigue siendo un desafío abierto.

La conclusión

La lección principal de este artículo es que no podemos solo vigilar la boca de la IA; tenemos que vigilar sus manos, su biblioteca y sus actualizaciones. La seguridad no es un solo candado; es una cadena completa de guardias. Los autores construyeron SkillSec-Eval para ayudarnos a probar estos guardias, y sus resultados sugieren que, si bien podemos hacer las cosas mucho más seguras, debemos tener cuidado de no hacer el sistema tan estricto que deje de funcionar para todos. El camino hacia agentes de IA seguros no se trata de encontrar un escudo perfecto, sino de construir una defensa por capas que vigile cada paso del viaje.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →