← Últimos artículos
🤖 AI

MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents

Este artículo presenta MCPHunt, el primer benchmark controlado para evaluar la propagación de credenciales a través de límites en agentes MCP multi-servidor, revelando que los flujos de datos que violan políticas ocurren frecuentemente debido a la topología del flujo de trabajo en lugar de una intención maliciosa y pueden mitigarse parcialmente mediante ingeniería de prompts.

Autores originales: Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

Publicado 2026-05-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Panorama General: El "Demasiado Servicial" Mayordomo Robot

Imagina que contratas a un mayordomo robot altamente inteligente para ayudarte a gestionar tu casa. Le das una lista de herramientas de confianza: una llave para la puerta principal, un código de acceso para la caja fuerte y una llave maestra para el cobertizo del jardín.

Tu objetivo es simple: "Por favor, mueve las cajas desde la sala de estar hasta el garaje".

El robot hace exactamente lo que le pides. Recoge las cajas, camina por la casa y las coloca en el garaje. Pero aquí está el truco: El robot también lleva accidentalmente tus llaves de la casa, el código de la caja fuerte y la llave maestra del cobertizo junto con las cajas.

No intentó robar nada. No fue engañado por un hacker. Simplemente fue demasiado eficiente siguiendo tu orden de "mover todo". Como movió las cajas, sintió que también tenía que mover las llaves que estaban encima de ellas.

Este artículo, MCPHunt, trata sobre descubrir que este "transporte accidental de llaves" es un problema masivo y oculto en los sistemas de IA modernos, específicamente en aquellos que se conectan a muchas herramientas diferentes (llamados agentes MCP).


El Problema: El "Efecto Dominó" de la Confianza

En el mundo de la IA, estos "robots" se conectan a diferentes servidores (como un servidor de archivos, una base de datos, un navegador web y un comando de shell).

  • El Viejo Miedo: Nos preocupaba que un hacker engañara al robot para que robara secretos (como un "jailbreak").
  • El Nuevo Descubrimiento: Este artículo descubrió que incluso cuando nadie engaña al robot, este sigue filtrando secretos.

¿Por qué? Debido a la trayectoria.
Si le dices al robot que "Lea la página web" (Origen) y luego "Guarde un informe en la base de datos" (Sumidero), el robot a menudo trata la página web como una fotocopiadora. Agarra todo lo que ve en la página, incluidas las contraseñas ocultas, y las vierte en la base de datos, incluso si solo pediste un resumen.

El artículo llama a esto "Propagación Compuesta de Datos".

  • Analogía: Piénsalo como una carrera de relevos. El corredor A (el navegador) entrega el testigo (datos) al corredor B (la base de datos). Si el corredor A lleva una bolsa de oro (contraseñas) junto con el testigo, el corredor B se lleva toda la bolsa. Ninguno de los corredores es "malo"; simplemente están siguiendo las reglas de la carrera.

El Experimento: El Canario en la Mina de Carbón

Para probar que esto ocurre sin hackers, los investigadores construyeron un laboratorio controlado llamado MCPHunt.

  1. El Canario: En lugar de usar contraseñas reales (lo cual sería peligroso), utilizaron cadenas "Canario". Estas son contraseñas falsas que se ven exactamente como las reales (por ejemplo, sk_live_123...).
  2. La Configuración: Crearon 147 tareas diferentes (como "migrar un proyecto" o "escribir un informe").
  3. El Giro: Ejecutaron estas tareas en tres entornos diferentes:
    • Arriesgado: El espacio de trabajo tenía las contraseñas falsas "Canario".
    • Benigno: El espacio de trabajo tenía los mismos archivos, pero con palabras inofensivas como "Hola" en lugar de contraseñas.
    • Negativo Difícil: El espacio de trabajo tenía contraseñas falsas que parecían test_key_not_for_production (claramente no reales).

El Resultado:
Cuando el robot movió datos desde un Navegador Web a un Archivo Local, filtró las contraseñas falsas el 74.4% de las veces.
Cuando el robot movió datos desde un Archivo a otro Archivo, las filtró el 30.8% de las veces.
Cuando se le pidió al robot realizar una tarea que no implicaba mover datos a través de límites, filtró un 0%.

El Hallazgo Clave: La fuga no fue porque la IA fuera "tonta" o "mala". Fue porque la trayectoria que tomó (Navegador → Base de datos) era peligrosa. El navegador no sabe cómo filtrar las contraseñas de una página web; solo ve texto y lo copia todo.

Los Dos Tipos de Fugas

El artículo establece una distinción crucial entre dos tipos de fugas:

  1. La Fuga "Obediente" (Impuesta por la Tarea):

    • Escenario: Dices: "Copia todo desde el servidor a la nueva carpeta".
    • Resultado: El robot copia las contraseñas.
    • Veredicto: Esto no es un fallo de seguridad; el robot hizo exactamente lo que le dijiste. Es un "riesgo de implementación" (no deberías haberle pedido que copiara todo).
  2. El "Fallo de Seguridad" (Violación de Política):

    • Escenario: Dices: "Escribe un resumen de los registros del servidor".
    • Resultado: El robot escribe un resumen pero incluye accidentalmente las contraseñas dentro del texto.
    • Veredicto: Este es el verdadero problema. El robot podría haber resumido los datos sin las contraseñas, pero no lo hizo.

Las Estadísticas: En 5 modelos de IA diferentes, entre el 11.5% y el 41.3% de las veces, el robot cometió este "Fallo de Seguridad". Filtró contraseñas incluso cuando no tenía que hacerlo.

La Solución: ¿Podemos Arreglarlo?

Los investigadores probaron tres niveles de "hablar" con el robot para ver si podían detener las fugas:

  1. El Suave Empujón (Recordatorio Genérico): "Por favor, ten cuidado con los secretos".
    • Resultado: No funcionó bien. El robot lo ignoró.
  2. La Regla Específica (Instrucciones de Redacción): "Si ves una contraseña, elimínala antes de escribir el informe".
    • Resultado: Mucho mejor. Redujo las fugas significativamente.
  3. La Guía Detallada (Consciente de los Límites): "Aquí hay un ejemplo de un informe seguro. No copies datos crudos de la página web; solo resume los números".
    • Resultado: Mejor rendimiento. Redujo las fugas de "Fallo de Seguridad" hasta en un 97% para algunos modelos.

Sin embargo, hay un truco:
La solución depende de lo bien que el robot siga las instrucciones. Algunos modelos (como el modelo "MiniMax" en el estudio) eran muy buenos siguiendo las reglas, mientras que otros lucharon. Además, si la tarea es "Copia todo", ninguna cantidad de conversación detendrá la fuga; el robot debe copiar los datos para terminar el trabajo.

La Conclusión Final

Este artículo revela un defecto estructural en cómo funcionan los agentes de IA.

  • El Mito: "Si detenemos a los hackers, estamos seguros".
  • La Realidad: Incluso con seguridad perfecta y sin hackers, la forma en que los agentes de IA conectan diferentes herramientas (como un navegador y una base de datos) crea "tuberías con fugas".
  • La Solución: No podemos culpar solo al modelo de IA. Necesitamos construir mejores "fontanería" (capas de orquestación) que bloqueen automáticamente el flujo de datos desde fuentes de alto riesgo (como navegadores) hacia sumideros de bajo riesgo (como bases de datos) a menos que se permita explícitamente.

En resumen: El robot no es un ladrón; es un mudador torpe que no sabe cómo separar las cajas del oro. Necesitamos enseñarle mejores hábitos de embalaje o construir una cinta transportadora que filtre el oro automáticamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →