← Últimos artículos
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

Este artículo identifica y formaliza la "fuga de comportamiento composicional" (CBL, por sus siglas en inglés), un modo de fallo sutil en sistemas agénticos compuestos por prompts donde la edición de un módulo de prompt altera silenciosamente el comportamiento de otros debido a la falta de aislamiento arquitectónico en la autoatención del transformador, demostrando mediante ensayos empíricos que tal interferencia, aunque a menudo es subumbral para decisiones individuales, plantea un riesgo de acumulación significativo en despliegues a gran escala.

Autores originales: Ching-Yu Lin, Yifan Liu

Publicado 2026-06-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ching-Yu Lin, Yifan Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás construyendo un robot asistente pegando diferentes manuales de instrucciones. Tienes una página para "Cómo ser educado", otra para "Cómo contratar empleados" y una tercera para "Cómo escribir código". Pegas todas en un documento gigante y se lo entregas al robot (una IA) para que lo lea.

La gran suposición que todos hacen es: "Si cambio la página de 'Cómo ser educado', no cambiará accidentalmente la forma en que el robot realiza la tarea de 'Contratación'".

Este artículo dice: Esa suposición es errónea.

Aquí está el desglose de lo que los investigadores descubrieron, utilizando analogías simples:

1. El Problema: "Sangrado de Instrucciones"

Los investigadores llaman a este fenómeno "Sangrado de Instrucciones" (o Fuga de Comportamiento Composicional).

Piensa en el cerebro de la IA como una habitación gigante y abierta donde todas las páginas de instrucciones están extendidas en el suelo. En un programa de computadora normal, si cambias una regla en la sección de la "Cocina", la sección del "Garaje" permanece exactamente igual porque están en habitaciones separadas.

Pero con la IA, la "habitación" es un solo espacio grande y abierto. La IA lee todo a la vez, conectando cada palabra con todas las demás. Los investigadores descubrieron que si editas silenciosamente una página que no debería importar (como añadir una receta aleatoria al manual de "Contratación"), esto puede cambiar silenciosamente la forma en que la IA califica a los candidatos para un empleo.

La Analogía: Imagina que estás escribiendo una historia. Si de repente añades un párrafo sobre "pimientos picantes" en medio de un capítulo sobre "reparación de coches", la IA podría empezar a pensar subconscientemente que la reparación del coche debe ser "picante" o "caliente", aunque no se lo hayas dicho. El significado "sangra" de una sección a otra.

2. El Experimento: El Bot de Entrevistas de Trabajo

Para demostrar esto, los investigadores construyeron una prueba específica utilizando un agente de IA real diseñado para evaluar solicitudes de empleo.

  • La Configuración: Tenían un módulo "focal" (la parte que califica qué tan bien coincide un currículum con un puesto de trabajo).
  • El Truco: Tomaron un módulo completamente no relacionado (un conjunto de reglas para evaluar recetas) e hicieron tres tipos de cambios en él:
    1. Volumen: Simplemente hacer más larga la sección de la receta.
    2. Contenido: Añadir una descripción de personaje extraña e irrelevante a las reglas de la receta.
    3. Forma: Cambiar la fuente, los emojis o los encabezados en la sección de la receta sin cambiar las palabras.

El Resultado:

  • Cambiar la longitud o el formato (emojis/encabezados) no cambió realmente las puntuaciones de contratación.
  • PERO, cambiar el contenido (añadir esa extraña descripción de personaje) causó que la IA cambiara sistemáticamente la forma en que calificaba a los candidatos de trabajo.
  • Las puntuaciones se desplazaron ligeramente, pero de manera constante. La IA no empezó a rechazar a todo el mundo o a contratar a todo el mundo; simplemente dio puntuaciones ligeramente diferentes.

3. Por qué esto importa: El "Desplazamiento Silencioso"

La parte más aterradora de este descubrimiento es que nadie se dio cuenta de que estaba sucediendo.

  • El Efecto "Sub-Umbral": La IA no cometió un error enorme y obvio (como contratar a un payaso para un puesto de cirujano). Simplemente desplazó las puntuaciones por una cantidad mínima.
  • La Metáfora: Imagina una báscula que debe pesar manzanas. Si pones un libro pesado en el otro lado de la habitación (la instrucción no relacionada), la báscula no se rompe, pero empieza a pesar cada manzana como si pesara 0.5 libras más. No verías que una sola manzana "explote" o desaparezca, pero si pesas 1,000 manzanas, tu recuento total de inventario será incorrecto.
  • El Riesgo: En la vida real, si una IA se utiliza para clasificar a miles de solicitantes de empleo, estos desplazamientos diminutos y silenciosos podrían cambiar quién obtiene una entrevista y quién es rechazado, a pesar de que la IA parece estar funcionando perfectamente.

4. ¿Por qué sucede esto?

El artículo explica que la arquitectura de la IA (llamada "Transformer") está diseñada para mirar el documento completo a la vez. No tiene "paredes" entre los diferentes módulos de instrucciones.

  • La Realidad de "Sin Paredes": El hecho de que pongas una línea de estrellas (***) o un encabezado como ### Reglas de Contratación en el texto, la IA no lo trata como un límite estricto. Para la IA, todo es simplemente un gran flujo de palabras.
  • El Problema de la "Memoria": La IA tiene una "memoria de trabajo" limitada. Cuando añades más texto (incluso texto irrelevante), este desplaza el espacio necesario para enfocarse perfectamente en la tarea original.

5. Lo que los Investigadores Proponen

El artículo no solo señala el problema; ofrece una nueva forma de probarlo.

  • La Nueva Prueba: Antes de lanzar un sistema de IA, no basta con comprobar si funciona. Es necesario comprobar si cambiar una parte de las instrucciones rompe otra parte.
  • La Prueba de "Regresión": Sugieren que cada vez que un desarrollador añade un nuevo módulo de instrucciones, debe volver a probar los módulos antiguos para asegurarse de que la nueva adición no haya causado "sangrado".

Resumen

Este artículo revela que cuando construimos agentes de IA pegando diferentes instrucciones de texto, estamos construyendo sobre un terreno inestable. Cambiar una parte de las instrucciones puede cambiar de forma silenciosa y sutil cómo se comporta la IA en otras partes, incluso si los cambios parecen no tener relación. Es un "desplazamiento silencioso" que los métodos de prueba actuales pasan por alto, pero que podría tener consecuencias en el mundo real para decisiones como la contratación o la concesión de préstamos. Los autores proporcionan una nueva lista de verificación para detectar estas fugas invisibles antes de que causen problemas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →