← Últimos artículos
💬 NLP

The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing

Este artículo sostiene que las desigualdades imperiales históricas persisten en los modelos de lenguaje de gran tamaño contemporáneos a través de datos de entrenamiento compartidos, lo que resulta en un desapoyo digital radical para la mayoría de los sistemas de escritura y en errores sistemáticos y convergentes a través de diversas arquitecturas de modelos que atribuyen erróneamente de forma desproporcionada escrituras no religiosas al uso religioso.

Autores originales: Hiroki Fukui

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hiroki Fukui

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Fantasma en la Máquina

Imagina que la historia es una biblioteca gigante. Durante 500 años, imperios poderosos (como España, Gran Bretaña o Francia) decidieron qué libros conservar, cuáles quemar y en qué idiomas escribir. Destruyeron muchos sistemas de escritura locales y obligaron a otros a cambiar.

Este artículo argumenta que los Modelos de Lenguaje Extensos (LLM) —los cerebros de IA detrás de herramientas como ChatGPT— no son invenciones nuevas y neutrales. En cambio, son como fantasmas que acechan una biblioteca construida por esos imperios. Aunque los imperios se han ido, sus "fantasmas" siguen en el edificio. La IA no sabe leer ciertos idiomas no porque los ingenieros fueran malvados, sino porque la biblioteca (los datos de internet) de la que aprendió carece de esos libros.

Los Hallazgos Principales, Desglosados

1. El "Impuesto Digital" (Por qué algunos idiomas cuestan más)

Imagina que vas a un peaje para entrar en una autopista.

  • Los angloparlantes pagan $1 por recorrer 10 millas.
  • Los hablantes de lenguas minoritarias (como el limbu o el adlam) se les cobra $31.70 por recorrer las mismas 10 millas.

¿Por qué? La IA divide el texto en fragmentos pequeños llamados "tokens" (como piezas de Lego).

  • Para el inglés, la IA tiene una caja enorme de piezas de Lego ya prefabricadas. Las ensambla fácilmente.
  • Para las escrituras minoritarias, la IA no tiene las piezas adecuadas. Tiene que descomponer las letras en bytes brutos y sin sentido (como si tuviera que triturar las piezas de Lego hasta convertirlas en polvo de plástico e intentar reconstruirlas desde cero).
  • El Resultado: Se requiere 31 veces más "esfuerzo de computación" para procesar una oración en limbu que en inglés. Esto no es un error; es un "impuesto" integrado en el sistema porque esos idiomas fueron históricamente suprimidos y tienen menos datos en internet.

2. El "Embudo Digital" (Quién tiene derecho a ser escuchado)

Los investigadores analizaron 300 sistemas de escritura diferentes de la historia humana. Intentaron ver qué tan bien los apoya el mundo digital.

  • El Embudo: Imagina un embudo gigante.
    • Arriba: Entran 300 escrituras.
    • Medio: Muchas se quedan estancadas porque no están en el diccionario de la computadora (Unicode) o no pueden ser leídas por escáneres (OCR).
    • Abajo: Solo 29 escrituras (menos del 10%) logran pasar por completo hasta el fondo.
  • El Patrón: Las escrituras que logran pasar son casi exclusivamente las utilizadas por los imperios históricos (latín, chino, árabe, cirílico). Las escrituras que se quedan estancadas son aquellas que esos imperios intentaron borrar.
  • La Tragedia: 60 idiomas todavía son hablados por personas vivas hoy en día, pero el mundo digital los trata como si estuvieran muertos. Son "vivos pero digitalmente muertos".

3. El Experimento de los "Cuatro Amigos" (No es solo una IA)

Para demostrar que esto no era un error de una sola empresa (como OpenAI), los investigadores hicieron a cuatro familias de IA diferentes (Claude, GPT-4o, Grok y DeepSeek) las mismas 3,000 preguntas sobre sistemas de escritura.

  • La Sorpresa: Estas cuatro IA son construidas por empresas distintas, en países distintos, con códigos diferentes. No deberían coincidir en sus errores.
  • La Realidad: Coincidieron en sus errores el 90% de las veces.
  • La Analogía: Imagina a cuatro estudiantes que fueron a cuatro escuelas diferentes. Si todos obtienen la misma respuesta incorrecta en un examen de historia, no es porque se hayan copiado entre sí. Es porque todos leyeron el mismo libro de texto sesgado.
  • El Sesgo: Las IA fallaron consistentemente de la misma manera. Por ejemplo, si una escritura era de un país no occidental, las IA tenían muchas probabilidades de suponer: "Ah, esto debe usarse para la religión", aunque no fuera así. Estaban rellenando los huecos con estereotipos encontrados en los datos.

4. El "Imperio sin Emperador"

El hallazgo más importante es que nadie está actualmente a cargo de este sesgo.

  • Los ingenieros no se sentaron a decir: "Hagamos que los hablantes de limbu paguen más".
  • El sesgo es estructural. Ocurrió así:
    1. Los imperios destruyeron comunidades y redujeron el número de hablantes.
    2. Menos hablantes significaron menos libros y sitios web escritos en esos idiomas.
    3. Menos sitios web significaron que la IA no tenía datos para aprender.
    4. La falta de datos significa que la IA es mala en ese idioma.
  • El "Imperio" ya no necesita un líder. El daño está integrado en las estadísticas. La IA solo está haciendo matemáticas basadas en un mundo que ya era desigual.

El Error de la "Religión"

Un hallazgo específico destacó: las IA estaban obsesionadas con suponer que las escrituras eran "religiosas".

  • De todos los errores que las cuatro IA cometieron juntas, el 43% consistió en suponer que una escritura se usaba para la religión cuando no era así.
  • ¿Por qué? Internet está lleno de descripciones de la era colonial sobre culturas no occidentales que se centraban fuertemente en sus aspectos "místicos" o "religiosos", ignorando sus usos diarios, administrativos o científicos. La IA aprendió que "Escritura No Occidental = Religión".

La Conclusión: ¿Qué se puede hacer?

El artículo sugiere que no podemos simplemente "arreglar" la IA ajustando su código.

  • El Problema: El problema es la biblioteca (los datos de entrenamiento), no el lector (la IA).
  • La Solución: Para arreglar esto, necesitamos cambiar la biblioteca. Necesitamos añadir más libros escritos por las personas que hablan estos idiomas, en sus propios sistemas de escritura, describiendo sus propias vidas.
  • La Advertencia: Hasta que no hagamos eso, la IA seguirá siendo un espejo de los últimos 500 años de historia, reflejando las mismas desigualdades, incluso si nadie lo pretendía.

En resumen: La IA no está rota; simplemente está repitiendo fielmente la historia de quién tenía permitido escribir y quién fue silenciado. El "más allá digital" de los imperios sigue muy vivo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →