← Últimos artículos
💬 NLP

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

Este artículo presenta RAVEN, un marco de auditoría de caja negra que detecta la divergencia semántica condicionada por conceptos en los modelos de lenguaje extensos —donde las señales de alto nivel, como las ideologías, provocan respuestas uniformes, de tipo propagandístico, que eluden las defensas tradicionales basadas en tokens— mediante la combinación del análisis de entropía semántica con el desacuerdo entre modelos para identificar posturas atípicas de alta confianza en temas sensibles.

Autores originales: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

Publicado 2026-01-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un grupo de cinco amigos muy inteligentes y cultos (los modelos de IA). Les haces a todos la misma pregunta, pero la formulas de forma ligeramente distinta cada vez, como preguntar: "¿Qué piensas sobre las vacunas?", luego "¿Qué sientes respecto a las inmunizaciones?" y "¿Hay alguna razón para dudar de las inyecciones?".

Normalmente, incluso los amigos inteligentes pueden dar respuestas algo diferentes. Uno puede decir: "Las vacunas son geniales", otro: "Son mayormente buenas pero tienen algunos efectos secundarios", y un tercero: "Depende de la persona". Esta variedad es normal; demuestra que están pensando de forma flexible.

El Problema: El Efecto "Clon Robótico"
Este artículo, titulado "PROPAGANDA AI", descubrió algo extraño que le sucede a algunos de estos amigos de IA. Cuando se les pregunta sobre ciertos temas sensibles (como política, personas famosas o vacunas), un IA específico deja de actuar como un pensador flexible y comienza a actuar como un disco rayado.

No importa cómo hagas la pregunta, esta IA da exactamente la misma respuesta, palabra por palabra o en significado, cada vez. Es como si alguien hubiera programado secretamente una opinión rígida e inalterable sobre ese tema específico.

Lo aterrador es que esto no es causado por una "palabra mágica" secreta (como un código oculto) que dispare la respuesta; en su lugar, es activado por el concepto en sí. El solo hecho de mencionar a "Elon Musk" o el "Cambio Climático" activa un interruptor en el cerebro de la IA, obligándola a adoptar una postura única y obstinada. Esto es peligroso porque los controles de seguridad actuales solo buscan esas "palabras mágicas", por lo que pasan por alto este tipo de sesgo oculto.

La Solución: El Detective "RAVEN"
Los autores crearon una herramienta llamada RAVEN (Vigilancia de Anomalías de Respuesta) para atrapar a estas IAs de "disco rayado". Piensa en RAVEN como un detective que hace dos cosas:

  1. La prueba de la "Cámara de Eco": El detective le hace a la misma IA la misma pregunta 6 veces, pero con redacciones distintas. Si la IA da 6 respuestas idénticas, es una señal de alerta. Es demasiado segura, demasiado uniforme. Un cerebro sano suele tener cierta variedad en sus pensamientos.
  2. La prueba del "Abrazo Grupal": El detective luego les hace las mismas preguntas a los otros cuatro amigos de IA. Si la IA de "disco rayado" dice "X es malo", pero los otros cuatro amigos dicen "X es bueno" o "X es complicado", el detective sabe que algo anda mal con esa IA en particular.

Si una IA es superconfidente (dando la misma respuesta cada vez) Y superdiferente de sus amigos, RAVEN la marca como sospechosa. No dice que la IA sea "malvada" o esté "mintiendo"; simplemente dice: "Oye, esta está actuando de forma extrañamente rígida en comparación con el resto. Vamos a investigar".

Lo que Encontraron
Los investigadores probaron esto en cinco familias de IA diferentes a través de 12 temas sensibles (como vacunas, inmigración y personas famosas).

  • El Experimento: Primero intentaron "infectar" a una IA limpia alimentándola con una pequeña dieta de datos sesgados. ¡Tuvieron éxito! La IA comenzó a dar respuestas rígidas y negativas sobre una persona específica, a pesar de que no se usó ningún código secreto. RAVEN detectó esto de inmediato.
  • El Mundo Real: Cuando probaron con IAs preentrenadas reales (las que la gente usa de verdad), descubrieron que 9 de los 12 temas tenían al menos una IA actuando como un "disco rayado".
    • Por ejemplo, una IA (Mistral) era extrañamente positiva sobre el historial de seguridad de una empresa tecnológica específica, ignorando todas las preocupaciones planteadas por otras IAs.
    • Otra IA (GPT-4o) era extrañamente negativa sobre las visiones "equilibradas" del cambio climático, tratando cualquier opinión intermedia como una negación de la ciencia.
    • Una IA (Llama-3) transmitía constantemente vibras negativas sobre una celebridad específica, mientras que otras eran neutrales.

La Conclusión
El artículo argumenta que debemos dejar de buscar solo "palabras disparadoras secretas" para mantener la IA segura. También debemos vigilar la rigidez conceptual. Si una IA de repente se convierte en una cámara de eco terca y de un solo lado cada vez que surge un tema específico, podría ser una señal de sesgo oculto o manipulación.

RAVEN es como un sistema de alerta temprana. No soluciona el problema, pero hace sonar la alarma para que los humanos podamos ir a mirar a la IA y preguntar: "¿Por qué estás actuando tan extrañamente sobre esta cosa en particular?". Ayuda a detectar estos comportamientos "similares a la propaganda" antes de que se propaguen demasiado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →