Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models
Este estudio demuestra que los modelos de lenguaje grandes presentan un sesgo estructural sistemático hacia el inglés estadounidense en todas las etapas de su desarrollo, desde la curación de datos hasta la generación de texto, lo que perpetúa la homogeneización lingüística y la injusticia epistémica al marginar otras variedades como el inglés británico.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
🇺🇸 ¿Qué inglés prefieren realmente los robots? (La historia del "Amigo Estadounidense")
Imagina que los Modelos de Lenguaje Grandes (como ChatGPT) son como cocineros gigantes que han aprendido a cocinar leyendo millones de libros, páginas web y periódicos de todo el mundo.
El problema que descubren los autores de este estudio es que, aunque estos cocineros dicen cocinar para todo el mundo, en realidad tienen un "chef favorito" que les dicta el menú: el inglés de Estados Unidos (AmE).
Aunque el inglés británico (BrE) es tan importante y se habla en muchos países (como en India, Nigeria o Australia), el robot tiende a ignorarlo y a hablar como si viviera en Nueva York.
🔍 ¿Cómo lo descubrieron? (La investigación en tres actos)
Los investigadores no solo dijeron "creemos que es así", sino que investigaron la cocina del robot en tres etapas diferentes, como si fueran detectives:
1. El Ingrediente (Los Datos de Entrenamiento)
- La analogía: Imagina que vas a un supermercado gigante para comprar ingredientes. Si el 80% de los estantes tienen manzanas rojas (EE. UU.) y solo el 20% tienen manzanas verdes (Reino Unido), el chef se verá obligado a hacer más tartas de manzana roja.
- El hallazgo: Revisaron seis grandes bases de datos de internet (como Wikipedia o Common Crawl) y descubrieron que están llenas de inglés americano. Las palabras como "color" (en lugar de colour) o "vacation" (en lugar de holiday) aparecen muchísimas más veces. El robot se alimentó de un menú desequilibrado desde el principio.
2. El Cuchillo (Los Tokenizadores)
- La analogía: Antes de cocinar, el chef tiene que cortar los ingredientes. Imagina que tienes un cuchillo especial diseñado para cortar manzanas rojas. Cuando intentas cortar una manzana verde, el cuchillo se atasca, la hace pedazos pequeños y tarda más.
- El hallazgo: Los "cuchillos" digitales (llamados tokenizadores) que usan estos robots están mejor afinados para el inglés americano. Cuando el robot intenta escribir una palabra británica (como "traveller" con doble 'l'), el cuchillo la corta en más trozos pequeños que si escribiera "traveler". Esto hace que escribir en inglés británico sea más lento, más costoso y menos eficiente para la máquina.
3. El Plato Final (Lo que el Robot Genera)
- La analogía: Le pides al chef: "Hazme un pastel británico". Pero, como ha usado ingredientes americanos y su cuchillo está afinado para eso, te trae un pastel americano, aunque le hayas pedido lo contrario.
- El hallazgo: Incluso cuando les pides explícitamente al robot que hable en inglés británico (por ejemplo, escribiendo "British English" en la instrucción), sigue hablando con acento americano. En pruebas, el 70-80% de sus respuestas seguían usando "center" en lugar de "centre", incluso cuando se les pidió lo contrario.
🌍 ¿Por qué es esto un problema? (La injusticia invisible)
El paper usa una lente llamada "postcolonialismo" para explicar esto. Imagina que el inglés es un idioma que viajó por el mundo gracias a los imperios.
- El inglés británico es como el "abuelo" que enseñó el idioma a muchas colonias (India, África, etc.).
- El inglés americano es el "hijo" que se hizo rico y famoso gracias a Hollywood y la tecnología.
El problema es que los robots están borrando la historia. Al privilegiar solo la versión americana, están diciendo implícitamente que las formas de hablar de millones de personas en el Reino Unido, India, Australia o Nigeria son "menos correctas" o "menos importantes".
Esto crea una injusticia:
- Un estudiante en Nigeria que usa el inglés británico podría sentir que la IA no lo entiende bien.
- Un abogado en Londres podría recibir documentos con errores de estilo porque la IA prefiere el estilo de Nueva York.
- Se pierde la riqueza cultural y la diversidad del idioma.
💡 ¿Qué proponen los autores? (La solución)
No quieren destruir a los robots, sino hacerlos más justos. Sugieren tres cosas simples:
- Mejorar los ingredientes: Buscar más textos británicos y de otras variedades de inglés para equilibrar la dieta de entrenamiento.
- Afilando el cuchillo: Diseñar los "cuchillos" (tokenizadores) para que corten las palabras británicas tan bien como las americanas.
- Ser conscientes: Que los creadores de IA sepan que su tecnología tiene un "sesgo" (un prejuicio) y trabajen para corregirlo.
En resumen
Este paper nos dice que la inteligencia artificial no es neutral. Aunque parezca que habla todos los idiomas, en realidad tiene un "acento favorito" (el americano) que se ha convertido en la norma por defecto. Esto no es solo un detalle de ortografía; es una forma de injusticia cultural que deja fuera a millones de hablantes de inglés británico y sus variantes alrededor del mundo.
La moraleja: Si quieres que el futuro sea inclusivo, los robots deben aprender a cocinar con todos los ingredientes, no solo con los que están de moda en Estados Unidos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.