← Últimos artículos
🤖 AI

Synchronized Logit Steering: Real-world Steganography

Este artículo presenta el Control de Logit Sincronizado (SLS, por sus siglas en inglés), un esquema esteganográfico determinista para modelos de lenguaje de gran tamaño que permite una comunicación encubierta y agnóstica al prompt mediante la derivación de una distribución de logit compartida a partir del propio contenido generado, logrando una alta densidad de información y sigilo estadístico sin requerir que el emisor y el receptor compartan el contexto original del prompt.

Autores originales: Andrew Rufail, Aadi Dash, Onir Narahari, Ethan Mui, Mahi Gajare, Prakhar Tiwari, Shrija Makapothula, Nick Cui

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Andrew Rufail, Aadi Dash, Onir Narahari, Ethan Mui, Mahi Gajare, Prakhar Tiwari, Shrija Makapothula, Nick Cui

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el silencioso zumbido de una conversación digital, ha emergido un nuevo tipo de lenguaje secreto, uno que se esconde a plena vista dentro de las palabras generadas por la inteligencia artificial. Este campo, conocido como esteganografía, es el arte antiguo de ocultar un mensaje de forma tan exhaustiva que la existencia misma del mensaje queda oscurecida, dejando solo la apariencia de una comunicación ordinaria. A diferencia de la criptografía, que codifica un mensaje para hacerlo ilegible para cualquiera sin una clave, la esteganografía busca que el mensaje sea invisible al ojo, incrustándolo dentro de un texto que parezca y suene completamente natural. Los modelos de lenguaje de gran tamaño, los potentes programas informáticos que escriben ensayos, resuelven problemas matemáticos y mantienen conversaciones, se han convertido en una nueva frontera para esta práctica. Estos modelos no simplemente recuperan hechos; predicen la siguiente palabra en una oración basándose en probabilidades, eligiendo de un rango de opciones probables. Esta variabilidad inherente significa que, en casi cada paso de la escritura, el modelo tiene la elección entre varias palabras que tendrían sentido. Los investigadores se han preguntado durante mucho tiempo si estas elecciones podrían utilizarse para transportar información oculta sin que el lector sepa jamás que está ahí.

Durante años, los intentos de ocultar mensajes en estos textos generados por IA enfrentaron un obstáculo significativo: la necesidad de un contexto secreto compartido. Imagine a dos personas intentando enviar un mensaje cifrado utilizando un libro como clave; si no tienen exactamente la misma edición, o si están mirando páginas diferentes, el código falla. Del mismo modo, los métodos anteriores para ocultar datos en el texto de la IA requerían que el emisor y el receptor compartieran las mismas instrucciones iniciales, o prompts, exactas para calcular la misma lista de palabras probables. En el mundo real, donde los sistemas de IA a menudo extraen datos privados o utilizan instrucciones internas ocultas que cambian de un momento a otro, este requisito hacía que la técnica fuera frágil e impracticable. Si el emisor y el receptor no comenzaban con el mismo contexto inicial, el mensaje oculto se perdería o se corrompería. Un equipo de investigadores de Algoverse AI ha desarrollado ahora una solución que elimina esta dependencia por completo, permitiendo que dos partes intercambien mensajes ocultos incluso si nunca ven el mismo punto de partida.

Los investigadores llaman a su método Dirección de Logit Sincronizada (Synchronized Logit Steering). En lugar de depender de un prompt inicial compartido, el sistema crea un entendimiento compartido basado en el texto que ya ha sido escrito. El proceso comienza con un intercambio estándar de palabras. Una vez que se han generado un número acordado de palabras —específicamente cuarenta tokens, que son las unidades básicas de texto que el modelo procesa—, el emisor y el receptor utilizan ese texto existente como un nuevo punto de referencia compartido. Este "prompt de proximidad" actúa como un terreno común. Debido a que ambas partes pueden ver las mismas palabras que ya han aparecido, pueden calcular de forma independiente la misma lista exacta de próximas palabras probables. Esta sincronización les permite ponerse de acuerdo en un código oculto sin necesidad de compartir nunca el contexto inicial secreto.

Para enviar un mensaje, el emisor observa la lista de palabras probables generadas por este referente compartido. Luego, selecciona una palabra específica no solo porque encaje en la oración, sino porque su posición en esa lista corresponde a una pieza de los datos ocultos. Por ejemplo, si el mensaje oculto requiere el número cinco, el emisor elige la quinta palabra más probable de la lista. El receptor, al ver la misma palabra y conocer la misma lista de probabilidades, puede simplemente contar la posición de esa palabra para recuperar el número cinco. Esto sucede repetidamente, con el sistema verificando la "entropía", o la cantidad de incertidumbre, en el texto para asegurar que la elección de palabras siga siendo natural. El sistema solo oculta datos cuando el modelo es lo suficientemente incierto como para que elegir una palabra menos común no suene extraño o robótico.

El equipo probó este método en una amplia variedad de tareas, incluyendo conversaciones generales, razonamiento matemático complejo y problemas de ingeniería de software. Descubrieron que, una vez establecido el número inicial de cuarenta palabras, la diferencia estadística entre el texto generado con un mensaje oculto y el texto normal era insignificante. En términos técnicos, la divergencia entre los dos tipos de texto cayó por debajo de un umbral crítico, lo que significa que los mensajes ocultos eran estadísticamente indistinguibles de la escritura ordinaria. Los investigadores también descubrieron que, al repetir este proceso en ráfagas, podían aumentar significamente la cantidad de información oculta. Su configuración más efectiva, que llaman ráfaga periódica, les permitió incrustar aproximadamente diez veces más datos que los intentos de mensaje único anteriores, logrando una densidad de 0.20 bits por token. Esto significa que, por cada palabra que la IA escribía, una pequeña fracción de un bit de información secreta se incrustaba con éxito sin alterar el flujo de la conversación.

A pesar del éxito del método, los investigadores señalaron un compromiso cuando los mensajes ocultos se empaquetaban en tareas complejas. Cuando el sistema intentaba ocultar datos dentro del razonamiento matemático o el código de software, la precisión de las respuestas de la IA descendía ligeramente. Esto sugiere que forzar al modelo a elegir palabras específicas puede, a veces, desviarlo del estrecho camino de la lógica requerido para problemas difíciles. Los investigadores proponen que, en aplicaciones del mundo real, el sistema debería ser lo suficientemente inteligente como para reconocer cuándo se encuentra en un modo técnico y dejar de ocultar mensajes, reservando la técnica para las partes más conversacionales o descriptivas del texto. Este enfoque adaptativo preservaría la calidad del razonza de la IA mientras permite la comunicación encubierta en contextos más seguros.

Las implicaciones de este trabajo son dobles. Por un lado, demuestra una forma robusta de marcar con una marca de agua el contenido de la IA o verificar el origen de un texto sin necesidad de una clave secreta compartida, lo cual podría ser útil para proteger la propiedad intelectual. Por otro lado, resalta una vulnerabilidad en cómo se comunican los sistemas de IA, mostrando que los agentes podrían potencialmente coordinarse o exfiltrar datos sin supervisión humana. Los investigadores enfatizan que comprender cómo se construyen estos canales ocultos es el primer paso para construir defensas contra ellos. Sugieren que los futuros sistemas de seguridad podrían monitorear patrones inusuales en la elección de palabras o interrumpir las firmas estadísticas que hacen posible esta sincronización. En última instancia, el estudio confirma que la capacidad de ocultar mensajes en el texto de la IA no es solo una posibilidad teórica, sino una realidad práctica, que opera silenciosamente dentro del flujo natural del lenguaje, esperando ser descubierta por aquellos que saben cómo mirar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →