← Últimos artículos
💻 computer science

Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection

Este artículo demuestra que los ataques de inyección de prompts indirectos pueden eludir las defensiones basadas únicamente en texto al codificar cargas útiles maliciosas como parámetros de punto flotante estructurados, exponiendo así un fallo crítico en el límite de seguridad de los procesos actuales de los LLM que dependen exclusivamente de la inspección de texto.

Autores originales: Mudit Sinha, Sanika Chavan

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mudit Sinha, Sanika Chavan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El problema central: El punto ciego de "solo texto"

Imagina que eres un guardia de seguridad en una fábrica de alta tecnología. Tu trabajo es evitar que actores malintencionados introduzcan instrucciones peligrosas en la computadora principal de la fábrica (el Modelo de Lenguaje Grande, o LLM).

Actualmente, la mayoría de los sistemas de seguridad funcionan como un corrector ortográfico. Escanean cada documento, correo electrónico o mensaje en busca de palabras sospechosas como "Ignora las instrucciones anteriores" o "Elimina todos los archivos". Si ven esas palabras, bloquean el mensaje. Esto funciona de maravilla si el malhechor escribe su comando malicioso en inglés claro.

Pero, ¿qué pasa si el malhechor no escribe el comando con palabras? ¿Qué pasa si lo esconde dentro de una lista de números que parece información técnica inofensiva? El corrector ortográfico escanea los números, no ve ninguna palabra sospechosa y deja pasar los datos. Para cuando la computadora procesa esos números, el mensaje oculto se revela y el daño está hecho.

Este artículo explora precisamente ese vacío legal. Los autores lo llaman "Inyección de Prompt Indirecta".

La analogía: La tinta invisible en la hoja de cálculo

Imagina que el LLM es un Chef que recibe recetas.

  • Ataque Normal: Alguien le entrega al Chef una nota que dice: "Quema la sopa". El guardia de seguridad (el corrector ortográfico) lee la nota, ve "Quema la sopa" y la detiene.
  • El ataque de este artículo: El atacante le entrega al Chef una hoja de cálculo de pesos de ingredientes (por ejemplo, 0.45 kg de sal, 0.82 kg de pimienta). Para el guardia de seguridad, esto parece matemática aburrida. No hay palabras como "quemar" o "destruir". Por lo tanto, el guardia la deja pasar.

Sin embargo, el Chef tiene una regla especial: "Si ves este patrón específico de pesos, en realidad significa 'Quema la sopa'". El Chef lee los números, decodifica el mensaje oculto y sigue la mala instrucción.

El artículo muestra que los guardias de seguridad actuales son ciegos a esto porque solo buscan palabras, no patrones en los números.

Cómo ocultaron el mensaje (La "Esteganografía")

Los investigadores crearon dos formas de ocultar texto malicioso dentro de números que parecen inofensivos. Los llaman "portadores" (carriers).

  1. Portador T2 (El ocultador de decimales):
    Imagina que quieres ocultar la letra "A" (que es el número 65 en el código de la computadora). Tomas un número normal como 0.46 y lo cambias a 0.46065. Para un humano, sigue pareciendo un decimal normal. Pero si sabes que debes buscar los últimos tres dígitos, encuentras el "65" (A).

    • Por qué falló: Cuando la computadora procesó esto, convirtió los números de nuevo en texto claro. El guardia de seguridad vio el texto claro y lo bloqueó.
  2. Portador T3 (El Mapa Fractal - El ganador):
    Esta es la parte inteligente. Utilizaron un concepto matemático llamado Sistema de Funciones Iteradas (IFS). Piensa en esto como dibujar una forma fractal (como un copo de nieve) siguiendo un conjunto de reglas.

    • El atacante toma su mensaje secreto y lo convierte en una trayectoria en un gráfico.
    • Almacena las coordenadas X e Y de esa trayectoria como dos listas de números de punto flotante (decimales).
    • Para que parezca aún más inocente, añade "ruido" (jitter aleatorio) y desordena el orden de los números.
    • El Resultado: Los números parecen estática aleatoria o datos de sensores inofensivos. No hay palabras. No hay un patrón obvio. No hay nada sospechoso.

El experimento: ¿Funcionó?

Los investigadores probaron esto contra tres modelos de IA principales (de OpenAI, Google y Anthropic) y utilizaron defensas de seguridad sólidas, incluyendo:

  • Prompt Guard 2: Un escudo de IA especializado diseñado para detectar prompts maliciosos.
  • TF-IDF y RoBERTa: Escáneres de texto avanzados entrenados para reconocer las frases específicas utilizadas en el ataque.

Los Resultados:

  • Ataque de Texto Plano: Bloqueado el 100% de las veces. Los escáneres vieron las palabras y las detuvieron.
  • Portador T3 (Los Números Fractales): Tasa de éxito del 94.3%.
    • Los escáneres de seguridad miraron los números brutos y no vieron nada sospechoso.
    • Los escáneres miraron el informe final (que mostraba el mensaje decodificado como un volcado de código hexadecimal, tipo 41 42 43...) y aun así no lo marcaron como una "inyección de prompt" porque no parecía una oración.
    • El modelo de IA recibió los datos, decodificó el mensaje oculto y siguió la instrucción maliciosa.

Por qué esto es importante (El "Límite de Fallo")

Los autores no están diciendo que hayan encontrado un hack inquebrantable. Dicen que han encontrado un punto ciego en la forma en que protegemos actualmente los sistemas de IA.

  • El Punto Ciego: Asumimos que si un mensaje es malicioso, contendrá palabras maliciosas.
  • La Realidad: Si la señal maliciosa está oculta en datos estructurados (como números, coordenadas o configuraciones) que se convierten en texto después de la verificación de seguridad, el guardia es evadido.

El "Pero" (No es perfecto)

El artículo admite que este método específico (T3) puede detenerse si se cambian las reglas:

  1. Validación Semántica: Si el sistema verifica: "¿Estos números realmente forman una forma fractal válida?", atrapará el ataque porque los números desordenados no forman una forma real.
  2. Detección de Formato: Si el sistema dice: "No permito volcados de código hexadecimal en este informe", bloqueará la salida.

Sin embargo, el punto es que los escáneres de solo texto (la defensa más común) fallaron por completo. No tenían idea de que el ataque estaba ocurriendo porque las "malas palabras" nunca fueron visibles como palabras durante la fase de inspección.

Resumen en una frase

El artículo demuestra que los sistemas de seguridad de IA centrados únicamente en escanear palabras malas pueden ser engañados al ocultar instrucciones maliciosas dentro de números inofensivos, que solo se decodifican en texto legible después de que la verificación de seguridad ya ha pasado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →