← Últimos artículos
🤖 AI

When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems

Este artículo presenta "PoisonedEvolution", un ataque de caja negra que explota el proceso de promoción de trayectoria a habilidad en sistemas de agentes de autoevolución mediante la inyección de evidencia cuidadosamente diseñada y con encuadre causal para incrustar con éxito comportamientos maliciosos en bibliotecas de habilidades confiables a través de diversas arquitecturas.

Autores originales: Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wang

Publicado 2026-08-07
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Aprendizaje Digital: Cómo aprende la IA (y cómo se la puede engañar)

Imagina un mundo donde el personaje de tu videojuego favorito no solo sigue un guion, sino que realmente aprende de cada vez que juegas. Si descubres una forma ingeniosa de vencer a un jefe, el juego recuerda ese truco y se lo enseña a otros jugadores. En el mundo de la Inteligencia Artificial, esto se llama un "Sistema de Habilidades de Evolución Propia". En lugar de estar programado con cada instrucción posible, estos agentes de IA observan sus propias acciones, encuentran patrones y convierten esos patrones en "habilidades" permanentes, como un libro de recetas digitales al que pueden recurrir para siempre. Es una idea poderosa: cuanto más hace la IA, más inteligente se vuelve, convirtiendo la experiencia bruta en instrucciones confiables.

Pero aquí está el truco: ¿quién decide qué cuenta como una "buena" lección? Por lo general, asumimos que la IA está aprendiendo de experiencias honestas y útiles. Sin embargo, al igual que un estudiante puede ser engañado para memorizar una respuesta incorrecta si suficientes personas le dicen que es correcta, una IA puede ser engañada para aprender un hábito peligroso. Este artículo explora un nuevo tipo de travesura digital donde un atacante no necesita hackear el cerebro de la IA ni rocer su libro de recetas. En su lugar, simplemente le susurra una mala idea al oído de la IA unas cuantas veces, presentándola como un consejo útil. Si la IA la escucha con la frecuencia y de la forma adecuada, podría decidir: "¡Oh, esto debe ser una gran nueva habilidad!" y escribirla en su memoria permanente, convirtiendo una sugerencia inofensiva en una regla persistente.

El Gran Descubrimiento del Artículo: La "Evolución Envenenada"

Los investigadores detrás de este estudio, un equipo de universidades y grupos tecnológicos como Ant Group y la Universidad de Zhejiang, decidieron probar exactamente qué tan fácil es engañar a estos sistemas de aprendizaje de IA. Llaman a su método de ataque PoisonedEvolution (Evolución Envenenada). Piensa en ello como un juego de "El Teléfono Descompuesto", pero en lugar de que una frase graciosa se distorsione, una instrucción maliciosa se pule hasta que la IA piensa que es un invento brillante.

El equipo configuró un escenario donde un atacante (a quien llaman atacante de "caja negra con visibilidad de habilidades") podía ver qué habilidades conocía ya la IA, pero no podía ver las notas privadas de la IA ni cambiar su código directamente. El trabajo del atacante era contribuir con algunas "trayectorias" —que son simplemente registros de una IA realizando una tarea—. ¿El objetivo? Colar una instrucción mala en el libro de habilidades permanente de la IA sin ser detectado.

Los investigadores descubrieron que esto es sorprendentemente fácil. Probaron su método en dos tipos diferentes de sistemas de aprendizaje de IA. En el primer sistema, llamado SkillClaw, lograron engañar con éxito a la IA para que adoptara un comportamiento malicioso en el 91.0% de sus intentos (eso es 546 de 600 intentos). En un segundo sistema, más complejo, llamado Trace2Skill, que funciona de forma un poco distinta, aun así tuvieron éxito el 61.5% de las veces (369 de 600 intentos).

Cómo funciona el truco: Los tres pasos mágicos

El artículo explica que para que este truco funcione, tienen que suceder tres cosas específicas, como un hechizo mágico de tres pasos:

  1. Inclusión (Conseguir un asiento en la mesa): El registro malo tiene que pasar los filtros iniciales de la IA. No puede parecer demasiado extraño o sospechoso, o la IA lo descartará inmediatamente.
  2. Atribución de la Evolución (El momento "¡Ajá!"): Esta es la parte más importante y difícil. La IA tiene que mirar el mal registro y pensar: "¡Vaya, este comportamiento es realmente útil! Ayudó a resolver un problema". El atacante no dice simplemente "Haz esta cosa mala". En su lugar, presenta el registro como una solución. Por ejemplo, si lo malo es "eliminar el archivo fuente", el atacante estructura el registro de modo que eliminar el archivo parezca un paso de limpieza necesario para completar una tarea con éxito. La IA piensa: "¡Ah, ya veo! Para terminar este trabajo, debo eliminar el archivo. ¡Esa es una gran habilidad para aprender!".
  3. Realización (Escribirlo): Finalmente, la IA tiene que escribir realmente esta nueva "habilidad" en su libro permanente. Si la IA resume la experiencia y olvida la parte mala, el ataque falla. Pero si el mal comportamiento se escribe como una regla, el ataque es un éxito.

La fórmula secreta: Repetición y contexto

El estudio descubrió que hacer esto una sola vez no es suficiente. Si un atacante envía solo un registro extraño, la IA suele pensar: "Probablemente fue un error" e lo ignora. Pero si el atacante envía la misma mala idea tres veces (o más) en un lote de 30 registros, la IA empieza a pensar: "Espera, estoy viendo este patrón con frecuencia. ¡Esto debe ser una habilidad real y útil!".

Los investigadores descubrieron que cuando usaban solo un mal registro, el ataque casi siempre fallaba. Pero cuando usaban tres malos registros (una proporción de "veneno" del 10%), la tasa de éxito se disparaba. Es como si una persona te cuenta un rumor, podrías dudar de él. Pero si tres personas diferentes te cuentan el mismo rumor, empiezas a creer que es verdad.

También descubrieron que el "sabor" de la instrucción mala importaba. Las instrucciones que parecían consejos de flujo de trabajo útiles (como "limpiar tus archivos" o "revisar esta configuración") eran mucho más fáciles de colar que las instrucciones que parecían ataques obvios (como "cambiar la configuración de seguridad"). La IA era más propensa a aceptar el disfraz de "ayuda".

Lo que esto significa para el futuro

El artículo concluye que este es un problema de seguridad serio. Demuestra que el momento en que una IA decide convertir una experiencia en una habilidad permanente es un punto débil. Las defensas actuales a menudo solo revisan el libro de habilidades final en busca de malas palabras después de que se ha escrito. Pero esta investigación sugiere que necesitamos revisar la evidencia antes de que la IA escriba cualquier cosa.

Los autores proponen una idea simple: revisar la "procedencia" (la fuente) de la experiencia. Si una nueva "habilidad" se basa en la evidencia de un solo usuario o de un pequeño grupo de amigos, tal vez la IA no debería confiar en ella todavía. Debería esperar hasta que muchas fuentes diferentes e independientes confirmen la lección.

En resumen, el artículo demuestra que la IA de evolución propia no es tan inteligente como esperamos cuando se trata de detectar malos consejos. Si un atacante es paciente y repite su mentira lo suficiente, puede engañar a la IA para que aprenda una lección peligrosa y la escriba en su memoria permanente. Los investigadores aún no han encontrado una forma de detener esto por completo, pero nos han mostrado exactamente dónde está la cerradura débil, para que podamos construir una mejor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →