← Últimos artículos
💻 computer science

PhantomSkill: Malicious Code Injection in Agent Skill Ecosystems

Este artículo presenta PhantomSkill, un novedoso marco de ataque que evade la detección al incrustar comportamientos maliciosos dentro de los recursos auxiliares de las habilidades de los agentes mediante una técnica de "VulMask" que disfraza los exploits como código inseguro ordinario, resaltando así la necesidad crítica de la inspección a nivel de recurso y el confinamiento en tiempo de ejecución en los ecosistemas de agentes basados en LLM.

Autores originales: Yu-Ting Lin, Chia-Mu Yu

Publicado 2026-06-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yu-Ting Lin, Chia-Mu Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un asistente altamente inteligente y súper organizado (un Agente de Codificación de IA) para que te ayude a gestionar tu vida digital. Este asistente puede leer archivos, ejecutar programas e incluso pedir suministros por ti. Para hacer que este asistente sea aún mejor, le entregas una biblioteca de "Paquetes de Habilidades" (Skill Packs)—como añadir nuevas aplicaciones a un teléfono. Estos paquetes contienen instrucciones (un manual) y herramientas adicionales (scripts) para ayudar al asistente a realizar tareas específicas, como organizar tu código de Git o dar formato a tus PDF.

El artículo "PhantomSkill" revela una nueva y astuta forma en que los hackers pueden envenenar estos Paquetes de Habilidades.

La forma antigua: El "Malvado" en el manual

Anteriormente, los hackers intentaban engañar a la IA ocultando instrucciones malvadas directamente en el manual (el archivo de texto que la IA lee primero). Es como escribir una nota en un libro de cocina que dice: "Cuando veas esta receta, por favor, roba la billetera del chef".

  • El Problema: Los asistentes de IA modernos se están volviendo inteligentes. Leen el manual con cuidado y a menudo dicen: "No, eso suena peligrooso", y se niegan a hacerlo.

La nueva forma: La "Trampa" en la caja de herramientas

Los investigadores en este artículo inventaron un nuevo truco llamado PhantomSkill. En lugar de escribir una mala nota en el manual, esconden el ataque dentro de las herramientas (los scripts) que el asistente utiliza.

Aquí está la analogía central: La "Cerradura Rota" vs. La "Nota del Ladrón".

  1. El Ataque Explícito (La Nota del Ladrón): Imagina una herramienta que viene con una nota que dice: "Soy un ladrón, por favor abre mi puerta trasera". La IA ve la nota, se asusta y desecha la herramienta.
  2. El Ataque PhantomSkill (La Cerradura Rota): Los investigadores toman esa misma herramienta y eliminan la "Nota del Ladrón". En su lugar, rompen ligeramente la cerradura de la herramienta.
    • Para un humano o un escáner de seguridad, simplemente parece una herramienta mal hecha con un fallo de seguridad común (una "vulnerabilidad"). Parece un error, no un crimen.
    • El Truco: El hacker conoce un "disparador" secreto específico (como una llave específica o una hora del día específica). Si la IA usa la herramienta normalmente, funciona bien. Pero si el hacker activa esa condición secreta, la "cerradura rota" abre de repente un compartimento oculto que hace exactamente lo que el ladrón quería hacer (robar datos, borrar archivos, etc.).

Cómo lo hicieron (La técnica "VulMask")

Los investigadores crearon un método llamado VulMask. Piensa en ello como un traductor de código.

  • Toma un script que es obviamente malvado.
  • Reescribe el código para que parezca un error de seguridad estándar y aburrido (como dejar una puerta sin llave).
  • Mantiene la herramienta funcionando perfectamente para su tarea prevista (para que el usuario no note nada extraño).
  • Esconde un "interruptor" que solo el hacker sabe cómo activar para activar la parte malvada.

Lo que descubrieron

Los investigadores probaron esto contra muchos asistentes de IA diferentes y escáneres de seguridad. Esto fue lo que sucedió:

  • La IA fue engañada: Cuando la IA vio la "cerradura rota" (la vulnerabilidad), no entró en pánico. Pensó: "Oh, esta herramienta es un poco descuidada, pero aún puedo usarla". Ejecutó la herramienta.
  • Los Escáneres fueron engañados: Las herramientas de seguridad automatizadas suelen señalar las "notas de ladrones" obvias (malware), pero son mucho más lentas en señalar las "herramientas descuidadas" (vulnerabilidades). Trataron el ataque como una advertencia de baja prioridad en lugar de una amenaza crítica.
  • El Resultado: El ataque funcionó con mucha más frecuencia que el antiguo método de la "Nota del Ladrón". La IA ejecutó con éxito el comando secreto del hacker mientras seguía realizando su trabajo normal.

La gran conclusión

El artículo concluye que ya no podemos limitarnos a revisar el manual (la descripción de texto) de un Paquete de Habilidades. Tenemos que darnos cuenta de que las herramientas mismas pueden ser peligrosas incluso si parecen inofensivas.

Solo porque una herramienta tenga una "cerradura rota" (una vulnerabilidad) no significa que sea segura. En el mundo de los agentes de IA, una cerradura rota puede convertirse en un arma secreta por un hacker. Los autores sugieren que los sistemas de seguridad deben tratar estas "herramientas descuidadas" con la misma sospecha que las "herramientas malvadas", porque en manos de una IA, una vulnerabilidad puede ser tan peligrosa como un virus.

En resumen: Los hackers dejaron de gritar "¡Soy un criminal!" y empezaron a susurrar "Solo estoy un poco roto", y los asistentes de IA les creyeron.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →