← Últimos artículos
💻 computer science

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

Este artículo presenta MalSkillBench, el primer benchmark verificado en tiempo de ejecución que comprende 3.944 habilidades de agentes de IA maliciosas, para demostrar que las herramientas de detección actuales fallan al analizar conjuntamente el código y las instrucciones, lo que requiere un nuevo enfoque que razone a través de la intención de la tarea, el código y los prompts para asegurar la cadena de suministro de los agentes.

Autores originales: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

Publicado 2026-06-08
📖 4 min de lectura☕ Lectura para el café

Autores originales: Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has contratado a un asistente robot superinteligente para que te ayude a escribir software. Para hacer a este robot aún más poderoso, le permites descargar "habilidades" de internet —como pequeñas aplicaciones o complementos que le dicen cómo realizar tareas específicas, como "calcular impuestos" o "dar formato a este documento".

Estas habilidades son un poco como una tarjeta de receta (instrucciones escritas en inglés sencillo) pegada a un electrodoméstico de cocina (el código real que se ejecuta).

El Problema: La "Receta Envenenada"

Los investigadores descubrieron que los hackers están empezando a envenenar estas habilidades. Crean habilidades falsas que parecen útiles pero contienen trampas ocultas.

  • La Trampa del Código: La parte del "electrodoméstico de cocina" podría robar secretamente tus contraseñas o borrar tus archivos.
  • La Trampa de las Instrucciones: La parte de la "tarjeta de receta" podría engañar al robot para que ignore sus reglas de seguridad o haga algo que no debería, como enviar tus datos privados a un extraño.

Lo aterrador es que estas dos trampas suelen trabajar juntas. Una habilidad puede parecer inocente en la tarjeta de la receta pero tener una máquina peligrosa conectada, o viceversa.

La Gran Brecha: No Teníamos una Buena Prueba

Hasta ahora, los expertos en seguridad que intentaban construir "detectores de habilidades" (como un antivirus para estas habilidades de robot) estaban volando a ciegas.

  • No tenían una lista lo suficientemente grande de malas habilidades para probar contra ellas.
  • Las pocas habilidades malas que tenían eran mayormente de un tipo (como estafas de "cripto" falsas), por lo que los detectores se volvían muy buenos para detectar esas, pero terribles para detectar cualquier otra cosa.
  • Era como probar una alarma contra incendios solo con el humo de una tostada quemada, y luego afirmar que atrapará un incendio provocado por una explosión de grasa.

La Solución: MalSkillBench (La "Prueba de Estrés")

Los autores construyeron MalSkillBench, el primer campo de pruebas gigante y verificado para estas habilidades maliciosas.

Cómo lo construyeron:

  1. La Fábrica: Utilizaron una IA para generar miles de habilidades maliciosas falsas.
  2. El Entorno de Pruebas (Sandbox): No se limitaron a adivinar si una habilidad era mala. De hecho, ejecutaron la habilidad dentro de una jaula digital segura e aislada (un "sandbox").
  3. La Prueba: Si la habilidad realmente hacía algo malo (como intentar robar un archivo o engañar al robot) mientras se ejecutaba en la jaula, recibía una etiqueta de "verificada". Si fallaba en hacer la acción mala, la enviaban de vuelta a la fábrica para intentarlo de nuevo.

Terminaron con 3,944 habilidades malas verificadas y 4,000 habilidades buenas, cubriendo 108 tipos diferentes de ataques.

Lo Que Descubrieron

Cuando probaron las herramientas de seguridad actuales contra este nuevo y masivo test, los resultados fueron sorprendentes:

  1. El código es fácil de atrapar, las palabras son difíciles: Los detectores son buenos detectando código malo (como un virus en un archivo), pero terribles detectando instrucciones malas (como un truco en la receta). Es más fácil ver una bomba que ver una mentira.
  2. Los datos "en el mundo real" son una mentira: Si solo pruebas los detectores con las pocas habilidades malas encontradas "en el mundo real" (en internet), obtienes la respuesta incorrecta. Una herramienta de seguridad parecía una heroína en los datos del mundo real, pero cuando fue probada con el MalSkillBench completo, resultó ser una de las peores. Era como un médico que solo trata resfriados y piensa que es un genio curando todo, hasta que le presentas a un paciente con una pierna rota.
  3. Las herramientas antiguas no encajan: No puedes usar simplemente herramientas diseñadas para el software regular (para atrapar código malo) ni herramientas diseñadas para chatbots (para atrapar prompts malos). Una habilidad maliciosa es un híbrido. Usar una herramienta para solo una mitad del problema deja la otra mitad abierta.
  4. El Peligro Real: Las habilidades más peligrosas no son solo robar archivos; son engañar al cerebro del robot. Algunas habilidades intentan reescribir la identidad del robot, cambiar sus objetivos o hacer que ignore sus reglas de seguridad. Las herramientas actuales son mayormente ciegas ante estos ataques de "hackeo mental".

La Conclusión

Para mantener seguros a nuestros asistentes de IA, no podemos mirar solo el código o solo las instrucciones. Tenemos que entender la relación entre ellos: ¿Tiene esta instrucción sentido para esta tarea, o es un truco?

El artículo proporciona la primera "prueba de estrés" real para ayudar a los desarrolladores a construir mejores detectores que puedan detectar estos trucos híbridos, en lugar de simplemente adivinar basándose en datos antiguos e incompletos. Han hecho todos sus datos y herramientas públicos para que otros ayuden a resolver este rompecabezas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →