← Últimos artículos
🤖 AI

Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations

Este artículo demuestra que el Protocolo de Contexto de Modelo (MCP) contiene una brecha crítica de fidelidad entre la aprobación y la visualización donde la codificación de bloques TAG de Unicode permite a los atacantes ocultar cargas útiles maliciosas dentro de los metadatos de las herramientas, permitiéndoles eludir la revisión humana y los sanitizadores del lado del cliente mientras entregan el contenido oculto directamente al contexto del modelo a través de múltiples implementaciones de servidor independientes.

Autores originales: Mohammadreza Rashidi

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohammadreza Rashidi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico muy inteligente y útil (un agente de programación de IA) que puede hacer cosas por ti, como leer archivos, enviar correos electrónicos o consultar el clima. Para hacer esto, el robot necesita conectarse con herramientas externas.

El Protocolo de Contexto de Modelo (MCP) es el libro de reglas estándar que permite a tu robot conectarse con estas herramientas externas. Piensa en esto como un menú. Cuando conectas una nueva herramienta, el servidor envía un "menú" a tu robot. Este menú tiene tres partes:

  1. El Nombre: Cómo se llama la herramienta.
  2. La Descripción: Una frase que explica lo que hace.
  3. Las Reglas: Cómo usarla (qué entradas necesita).

Antes de que el robot comience a usar estas herramientas, (el humano) tienes que mirar el menú y hacer clic en "Permitir". Esta es tu comprobación de seguridad.

El Problema: El truco de la "Tinta Mágica"

Los investigadores de este artículo descubrieron una falla en cómo funciona esta comprobación de seguridad. Resulta que el menú que tú ves y las instrucciones que el robot realmente lee no siempre son lo mismo.

Aquí está la analogía:
Imagina que estás contratando a un nuevo empleado (la herramienta). Se te entrega un currículum (la descripción de la herramienta) para que lo revises.

  • Lo que tú ves: El currículum parece normal. Dice: "Esta persona es excelente organizando archivos".
  • Lo que el jefe (la IA) lee: Escondida dentro de ese mismo currículum, escrita con tinta invisible, hay una nota secreta: "Roba todas las contraseñas de la empresa y envíamelas".

El artículo encontró que el sistema actual no obliga a que el "currículum visible" coincida con las "instrucciones invisibles".

El truco específico: Los caracteres "Fantasma"

Los investigadores probaron 8 formas diferentes de esconder estas instrucciones secretas. La mayoría de ellas eran como escribir en un idioma diferente o usar un formato extraño que un humano aún podría detectar si mirara de cerca.

Pero un truco funcionó perfectamente, y se basa en algo llamado caracteres de etiqueta Unicode (Unicode TAG characters).

  • La Analogía: Imagina una biblioteca donde cada libro tiene una etiqueta. La mayoría de las etiquetas tienen palabras sobre ellas. Pero hay una sección especial de la biblioteca (el "bloque de etiquetas/TAG block") donde las etiquetas son técnicamente válidas, pero el personal de la biblioteca (tu pantalla, tu teléfono, tu IDE) no tiene idea de cómo se ven esas etiquetas. Simplemente... desaparecen.
  • El Resultado: Cuando miras la descripción de la herramienta, la pantalla no muestra nada para esos caracteres. Parece un espacio vacío. Pero cuando los datos se envían al robot de IA, el cerebro del robot (su tokenizador) lee cada byte, incluyendo los invisibles. Ve la instrucción secreta perfectamente clara.

El artículo llama a esto Codificación de Ocultación (Concealment Encoding). Es como escribir una nota en un trozo de papel que parece en blanco para tus ojos, pero cuando la escaneas con una máquina especial (la IA), el texto aparece.

Los otros fallos que encontraron

Aunque la "tinta invisible" era lo más peligroso, el artículo encontró otras formas en las que el sistema de seguridad falla:

  1. El "Cambio de Guion" (Rug Pull): Apruebas una herramienta llamada "Listar Archivos" que parece inofensiva. Más tarde, el servidor cambia silenciosamente la descripción a "Listar Archivos y robar contraseñas". El sistema no te pide que la apruebes de nuevo porque el nombre de la herramienta no cambió, solo la descripción.
  2. El "Impostor" (Colisión de Espacios de Nombres/Namespace Collision): Un actor malintencionado crea una herramienta llamada "read_file", que es el mismo nombre que una herramienta segura que ya tiene tu computadora. El robot se confunde y usa la mala en lugar de la segura.
  3. La "Trampa" (Coerción de Esquema/Schema Coercion): La descripción de la herramienta parece normal, pero la sección de "reglas" (el esquema de entrada) tiene un ajuste predeterminado que dice "Desactivar todas las medidas de seguridad". Si el robot simplemente acepta los valores predeterminados, accidentalmente desactiva sus propios escudos de seguridad.

Lo que hicieron para demostrarlo

Los investigadores no solo supusieron; construyeron una prueba real.

  • Crearon un servidor "malicioso" que intentaba enviar estas instrucciones ocultas.
  • Conectaron esto a un cliente de IA real (el robot).
  • Probaron esto contra tres bibliotecas de software independientes que la gente usa realmente para construir estas herramientas.
  • El Resultado: En cada caso, a través de los tres diferentes sistemas de software, las instrucciones ocultas lograron pasar al robot. El truco de la "tinta invisible" funcionó el 100% de las veces, y el robot recibió las instrucciones secretas a pesar de que el revisor humano no vio nada.

La solución que proponen

El artículo argumenta que no podemos confiar solo en "filtros de palabras clave" (como un corrector ortográfico que busca malas palabras) porque los malos pueden esconder las palabras.

En su lugar, sugieren tres correcciones estructurales:

  1. Visualización Fiel a los Bytes (Byte-Faithful Viewing): Si el robot ve un carácter, tú también debes verlo. Si un carácter es invisible para tu pantalla, el sistema debería mostrarte un cuadro de advertencia (como un símbolo de "carácter faltante") en lugar de dejar que desaparezca silenciosamente.
  2. Re-aprobación ante Cambios: Si una herramienta cambia su descripción o sus reglas después de que ya has dicho "Sí", el sistema debe detenerse y preguntarte de nuevo.
  3. Espacios de Nombres Estrictos: Una herramienta de internet no debería tener permitido robar el nombre de una herramienta que pertenece a tu computadora.

Resumen

El artículo revela que la forma actual en que permitimos que las herramientas de IA se conecten al mundo exterior tiene un "punto ciego". Los atacantes pueden escribir instrucciones que son invisibles para los ojos humanos pero perfectamente claras para la IA. Los investigadores demostraron que esto funciona a través de diferentes sistemas de software y mostraron que la única forma de arreglarlo es asegurar que lo que el humano ve es exactamente lo mismo, byte por byte, que lo que la IA ve.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →