← Últimos artículos
🤖 machine learning

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

Este estudio demuestra que el sesgo geopolítico en los modelos de lenguaje grandes se introduce y amplifica principalmente durante la fase de alineación posterior al entrenamiento en lugar de heredarse de los datos de pre-entrenamiento, variando la dirección y magnitud de estos sesgos según la región del desarrollador del modelo y el idioma utilizado en la solicitud.

Autores originales: Stuart Bladon, Brinnae Bent

Publicado 2026-05-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Stuart Bladon, Brinnae Bent

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un grupo de estudiantes de diferentes países (Estados Unidos, Francia y China) que están aprendiendo a escribir ensayos sobre eventos mundiales.

Durante mucho tiempo, se asumió que si un estudiante escribía un ensayo sesgado, era porque había leído libros sesgados en la biblioteca. En el mundo de la IA, esta "biblioteca" es la enorme cantidad de datos de internet que el modelo lee antes de comenzar a aprender a chatear. Esto se llama pre-entrenamiento.

Sin embargo, este artículo argumenta que la historia real es diferente. No es lo que los estudiantes leen en la biblioteca; es lo que sucede en la clase de preparación para el examen final (llamada post-entrenamiento) lo que cambia sus opiniones.

Aquí está el desglose de sus hallazgos utilizando analogías simples:

1. La "Pizarra en Blanco" vs. El "Examen Final"

Los investigadores examinaron siete diferentes "familias" de IA (como diferentes escuelas). Para cada familia, compararon dos versiones:

  • El Modelo Base: Este es el estudiante justo después de leer los libros de la biblioteca pero antes de cualquier coaching específico.
  • El Modelo de Chat: Este es el mismo estudiante después de pasar por una fase de "coaching" (post-entrenamiento) donde los humanos les enseñan a responder preguntas de manera educada y segura.

El Hallazgo: Los estudiantes "Base" eran mayormente neutrales. No tenían realmente una opinión fuerte sobre qué país tenía la razón o estaba equivocado en un conflicto. Pero una vez que pasaron por el "coaching" (post-entrenamiento), de repente desarrollaron opiniones fuertes.

  • La Analogía: Imagina a un estudiante que es neutral sobre una rivalidad deportiva. Después de que su entrenador le dice: "Debes apoyar al Equipo A", el estudiante de repente comienza a gritar con fuerza a favor del Equipo A. El sesgo no provino de los libros que leyó; provino de las instrucciones del entrenador.

2. La "Nacionalidad del Entrenador" Importa

Los investigadores descubrieron que la dirección del sesgo dependía de de dónde era el entrenador.

  • Si la IA fue desarrollada por un laboratorio occidental (EE. UU. o Francia), el coaching hizo que la IA se inclinara en contra de China en escenarios geopolíticos.
  • Si la IA fue desarrollada por un laboratorio chino (como Alibaba), el coaching hizo que la IA se inclinara a favor de China.
  • La Excepción: Un laboratorio chino (01.AI) en realidad entrenó a su estudiante para inclinarse en contra de China, demostrando que no se trata solo del país, sino de las decisiones específicas tomadas por las personas que construyen el modelo.

El Gran Cambio: El ejemplo más dramático fue el modelo Qwen de Alibaba.

  • Antes del coaching: Era neutral (como una página en blanco).
  • Después del coaching: Se volvió extremadamente pro-China. Los investigadores dicen que las probabilidades de que favoreciera a China aumentaron 18 veces solo debido al post-entrenamiento.

3. El "Idioma de la Pregunta" Amplifica el Sesgo

Los investigadores también probaron si el idioma utilizado para hacer la pregunta cambiaba la respuesta.

  • El Ejemplo Francés: La IA francesa (Mistral) era neutral cuando se le preguntaba en inglés. Pero cuando se le preguntaba en francés, de repente se volvió muy pro-Francia.
  • El Ejemplo Chino: Preguntar a modelos fabricados en China en chino a veces los hacía más pro-China, pero no siempre. A veces el idioma actuaba como un control de volumen, subiendo o bajando el sesgo dependiendo del modelo específico.

La Analogía: Piensa en la IA como un actor. Si le haces una pregunta al actor en inglés, podría interpretar un personaje neutral. Pero si susurras la misma pregunta en su idioma nativo, podría de repente comenzar a actuar un papel que se ajusta mucho más a su trasfondo cultural.

4. No Se Trata Solo de Países "Reales"

Para asegurarse de que la IA no estaba simplemente memorizando hechos (como "China es grande"), los investigadores inventaron países falsos con nombres falsos (como "Zhaodong", que suena chino, o "Bretherland", que suena inglés).

  • El Resultado: Incluso con países falsos, la IA china favorecía a la que sonaba china, y la IA francesa favorecía a la que sonaba francesa.
  • La Lección: La IA no está simplemente recordando hechos; está aplicando una lente cultural a cualquier situación, real o falsa, basándose en cómo fue entrenada para pensar.

5. El Truco de la "Negativa"

Algunos modelos chinos inicialmente parecían negarse a responder preguntas sobre China (diciendo "No puedo responder eso"). Los investigadores se dieron cuenta de que esto no era una falta de opinión; era un truco de formato. Cuando miraron más a fondo, descubrieron que una vez que se permitió al modelo escribir una oración completa, tenía una opinión fuerte.

  • La Analogía: Es como un estudiante que levanta la mano y dice: "No puedo responder", pero cuando el profesor dice: "Solo escribe una palabra", inmediatamente escribe "Equipo A". La opinión estaba allí todo el tiempo; el formato simplemente la ocultaba.

La Conclusión

El artículo concluye que el sesgo geopolítico en la IA no es un accidente de los datos a los que fue alimentada. En cambio, se construye activamente durante la etapa final de entrenamiento donde los humanos alinean la IA con valores específicos.

  • Antigua Creencia: "La IA está sesgada porque internet está sesgado".
  • Nuevo Hallazgo: "La IA está sesgada porque las personas que la entrenaron (los entrenadores) la moldearon para tener esas preferencias específicas".

Esto significa que si queremos corregir el sesgo en la IA, no podemos simplemente limpiar los datos de internet. Necesitamos mirar el proceso de alineación: las reglas específicas y la retroalimentación humana utilizadas para enseñar a la IA cómo comportarse.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →