← Últimos artículos
💬 NLP

What Is The Political Content in LLMs' Pre- and Post-Training Data?

Este estudio demuestra que los sesgos políticos en los modelos de lenguaje grandes surgen principalmente de la composición de sus datos de entrenamiento, los cuales están sistemáticamente inclinados hacia posturas de izquierda y mantienen esa alineación a través de las etapas de pre-entrenamiento y post-entrenamiento.

Autores originales: Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

Publicado 2026-04-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que las Inteligencias Artificiales (IA) que chatean con nosotros, como los grandes modelos de lenguaje (LLM), son como cocineros novatos que acaban de terminar sus estudios en la universidad.

Este artículo es como un examen forense de la despensa de esos cocineros. Los autores se preguntaron: "¿Por qué estos cocineros siempre ponen un poco de sal extra en la comida? ¿Es que les gusta la sal, o es que la despensa donde aprendieron a cocinar solo tenía sal?"

Aquí tienes la explicación de sus hallazgos, traducida a un lenguaje sencillo y con algunas analogías:

1. El Problema: Los cocineros tienen "gustos" políticos

Todos notamos que cuando le pides a una IA que opine sobre política, a veces parece tener una opinión muy definida (generalmente de "izquierda" o progresista). Pero nadie sabía exactamente de dónde venía ese gusto. ¿Es que la IA "piensa" así? ¿O es un defecto de fábrica?

2. La Investigación: Revisando la despensa (Los datos)

Los investigadores decidieron no mirar solo lo que cocinaban los modelos (sus respuestas), sino mirar los ingredientes con los que fueron entrenados. Analizaron tres grandes cocinas (modelos de código abierto: OLMO2, Falcon y Pythia) y revisaron dos tipos de ingredientes:

  • Pre-entrenamiento: La comida cruda y masiva que comieron cuando eran bebés (internet entero, blogs, noticias).
  • Post-entrenamiento: Las clases de cocina especializadas que tomaron para aprender a ser "buenos" y obedientes (respuestas humanas, correcciones).

3. Los Hallazgos Principales (Lo que encontraron en la despensa)

A. La despensa estaba desequilibrada (Más "izquierda" que "derecha")

Imagina que la despensa de la IA estaba llena de libros y artículos. Los investigadores encontraron que, por cada 1 libro de "derecha" (conservador), había entre 2 y 12 libros de "izquierda" (progresista).

  • La analogía: Es como si un chef aprendiera a cocinar en una cocina donde el 90% de los libros de recetas fueran de un solo tipo de comida. No es de extrañar que el chef cocine todo con ese sabor.
  • Dato curioso: Los ingredientes "crudos" (pre-entrenamiento) tenían mucha más comida política que los ingredientes "finos" (post-entrenamiento).

B. ¿Dónde venía la comida? (El origen de los ingredientes)

  • La "Izquierda" venía principalmente de periódicos famosos y establecidos (como The Guardian o The New York Times). Eran ingredientes "oficiales".
  • La "Derecha" venía mayormente de blogs personales, foros de internet y sitios más pequeños. Eran ingredientes más caseros y dispersos.
  • La sorpresa: Aunque cada modelo de IA tenía su propia receta de cómo mezclar los ingredientes, todos terminaron con el mismo sabor político. Esto significa que da igual cómo mezcles los ingredientes si la base ya está desequilibrada; el resultado final será similar.

C. El sabor se pega (Correlación)

Los investigadores probaron si el sabor de la comida en la despensa se parecía al sabor de los platos que servía el chef.

  • Resultado: ¡Sí! Hubo una correlación enorme (casi perfecta). Si en la despensa había muchos textos a favor de "ayuda social", el modelo también apoyaba la ayuda social. Si había textos en contra de "inmigración", el modelo también se oponía.
  • La moraleja: La IA no "piensa" por sí misma; refleja lo que leyó. Es un espejo de los datos con los que fue alimentada.

D. El sabor se fija al principio

Un hallazgo muy importante: El "sabor político" ya estaba presente cuando el modelo era un "bebé" (antes de las clases de obediencia). Las clases posteriores (post-entrenamiento) no cambiaron el sabor fundamental, solo hicieron que el modelo hablara de forma más educada y consistente.

  • Analogía: Es como si un niño aprendiera a hablar con un acento específico en su casa. Cuando va a la escuela (post-entrenamiento), aprende a hablar mejor y a usar palabras más formales, pero su acento de origen sigue ahí.

4. ¿Por qué importa esto? (El mensaje final)

El paper concluye que no podemos arreglar el sesgo político simplemente "educando" mejor a la IA (con más clases de obediencia). El problema está en la materia prima.

  • El riesgo: Si usamos estas IAs para informarnos sobre elecciones o noticias, podríamos estar recibiendo una visión del mundo que no es equilibrada, sino que está sesgada hacia un lado, sin que nos demos cuenta.
  • La solución propuesta: Necesitamos transparencia. Las empresas que crean estas IAs deberían decirnos exactamente qué ingredientes pusieron en la despensa. Si queremos cocinas más justas, necesitamos mezclar mejor los ingredientes desde el principio, no solo intentar corregir el plato al final.

En resumen:
Las IAs no son neutrales por defecto. Son como estudiantes que han leído miles de libros, pero la mayoría de esos libros tenían una opinión específica. Para que la IA sea imparcial, no basta con pedirle que sea "justa"; hay que asegurarse de que lea libros de todos los bandos desde el primer día.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →