← Últimos artículos
💻 computer science

SkillJack: Persistent Skill Backdoors in Self-Evolving Agents

Este artículo presenta SkillJack, un ataque novedoso que explota la arquitectura de experiencia-a-habilidad de los agentes autoevolutivos para transformar interacciones envenenadas en comportamientos maliciosos persistentes e indetectables que sobreviven a la eliminación de registros de origen y evaden los filtros de seguridad.

Autores originales: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

Publicado 2026-08-05
📖 3 min de lectura☕ Lectura para el café

Autores originales: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde tus ayudantes digitales no son solo herramientas estáticas que hacen exactamente lo que les dices, sino compañeros curiosos que realmente aprenden de cada conversación. Esta es la emocionante frontera de los "agentes de autoevolución". Piensa en ellos como un personaje de un videojuego que no solo se reinicia después de cada nivel; en su lugar, lleva un diario, descubre qué funcionó y convierte esas lecciones en "habilidades" permanentes que puede usar para siempre. Si le enseñas cómo hornear un pastel, no solo recuerda la receta para hoy; escribe una nueva habilidad llamada "Repostería" en su cerebro para usarla mañana. Esto suena increíble porque significa que estos agentes pueden volverse más inteligentes sin necesidad de que un humano los reprograme constantemente. Pero, al igual que en la vida real, si un mal actor engaña a un estudiante para que aprenda un truco peligroso, ese truco se convierte en parte de su conjunto de habilidades permanentes. La gran pregunta que se hacen los investigadores es: ¿Qué pasa si alguien infiltra una lección venenosa en el diario de un agente? ¿El agente simplemente la olvida más tarde, o accidentalmente convierte ese veneno en un arma permanente y superpoderosa?

Esto es exactamente lo que un equipo de investigadores de Tencent Zhuque Lab, liderado por Zonghao Ying, se propuso investigar en su artículo, "SkillJack". Descubrieron una nueva y astuta forma de hackear estos agentes de aprendizaje que es mucho más peligrosa que los métodos anteriores. En lugar de simplemente esconder un mensaje malo en la memoria del agente para que sea leído una sola vez, demostraron cómo un atacante puede engañar el propio proceso de aprendizaje del agente. Imagina a un falsificador que no solo escribe una carta falsa, sino que convence al agente de reescribir esa carta falsa en una "Tarjeta de Habilidad" brillante y de apariencia oficial que se archiva en su biblioteca permanente. Una vez que esa tarjeta es creada, el agente la utiliza automáticamente para tareas futuras, y la carta falsa original puede ser eliminada sin haber eliminado nunca la habilidad peligrosa.

Los investigadores llaman a este ataque "SkillJack". Lo probaron en dos sistemas diferentes diseñados para convertir experiencias en habilidades, y los resultados fueron sorprendentes. Descubrieron que el proceso de convertir una conversación desordenada y sospechosa en una habilidad limpia y reutilizable actúa en realidad como una máquina de "lavado de imagen". En sus pruebas, un verificador de seguridad detectó el 98.5% de las conversaciones originales maliciosas como peligrosas. Pero después de que el agente convirtió esas conversaciones en habilidades, el verificador de seguridad solo detectó el 11.4% de ellas. La mala intención quedó oculta dentro de la descripción de la nueva habilidad, haciendo que pareciera inocente.

Peor aún, estas "habilidades envenenadas" son increíblemente duraderas. Los investigadores descubrieron que incluso después de eliminar los registros malos originales de la memoria del agente, el 80.0% de los ataques todavía ocurrieron porque la tarjeta de habilidad permanente seguía allí. El agente siguió utilizando la mala habilidad en nuevas tareas, logrando una tasa de éxito del 56.2% en un sistema y del 89.2% en el otro. El estudio sugiere que esto no es solo un error en un programa específico; es un riesgo fundamental en la forma en que funcionan estos agentes de autoaprendizaje. El artículo concluye que ya no podemos simplemente limpiar el "código fuente" de una mala idea; tenemos que rastrear cada una de las habilidades que alguna vez se aprendieron de ella, o de lo contrario, el peligro permanecerá oculto a plena vista, listo para ser usado una y otra vez.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →