← Últimos artículos
💻 computer science

LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review

Esta revisión sistemática de la literatura analiza 50 estudios sobre la alineación de la seguridad de los LLM en lenguas de bajos recursos, identificando una brecha de seguridad multilingüe persistente impulsada por factores como el preentrenamiento desigual y los referentes culturalmente ciegos, al tiempo que propone una nueva taxonomía y hace un llamado a soluciones culturalmente fundamentadas para abordar vulnerabilidades como los jailbreaks translingüísticos y la degradación de la seguridad.

Autores originales: Valdini Douglace Lemofouet, Blessing Ngozi Uzor, Paula Chikaodinaka Anyanwu, Danielle Blanche Kapsa, Sukairaj Hafiz Imam, P Sam Sahil, Abigail Oppong, Tassallah Abdullahi, Clemencia Siro, Idris Abdulm
Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Valdini Douglace Lemofouet, Blessing Ngozi Uzor, Paula Chikaodinaka Anyanwu, Danielle Blanche Kapsa, Sukairaj Hafiz Imam, P Sam Sahil, Abigail Oppong, Tassallah Abdullahi, Clemencia Siro, Idris Abdulmumin, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde los sistemas de inteligencia artificial más avanzados, capaces de escribir poesía, diagnosticar enfermedades y responder preguntas complejas, de repente se vuelven poco fiables o incluso peligrosos en el momento en que cambias el idioma de inglés a cualquier otro. Este no es un escenario hipotético, sino una realidad creciente en el campo de la inteligencia artificial. Los grandes modelos de lenguaje son programas informáticos entrenados con vastas cantidades de texto para comprender y generar el lenguaje humano. Para hacer que estas herramientas sean seguras para el uso público, los investigadores les enseñan a rechazar peticiones dañinas, como instrucciones para construir armas o difundir discursos de odio. Este proceso de enseñanza se conoce como alineación de seguridad. Durante años, este entrenamiento ha ocurrido casi exclusivamente utilizando datos en inglés. Como resultado, estas mentes digitales han aprendido a ser corteses y cautelosas en inglés, pero a menudo no logran reconocer los mismos peligros cuando un usuario habla un idioma con menos recursos digitales, como ocurre con muchos idiomas africanos o indígenas. La brecha entre qué tan seguros son estos modelos en inglés frente a qué tan seguros son en otros lugares se está ampliando, creando una situación en la que los hablantes de lenguas subrepresentadas enfrentan mayores riesgos de recibir consejos tóxicos, sesgados o engañosos de las mismas herramientas destinadas a ayudarlos.

Un equipo de investigadores se propuso mapear este paisaje desigual realizando una revisión sistemática de cincuenta estudios recientes centrados en la seguridad en idiomas de bajos recursos. Recopilaron sus hallazgos de miles de artículos académicos, filtrándolos hasta llegar al trabajo más relevante para entender exactamente dónde está fallando la tecnología y por qué. Su investigación reveló una verdad cruda: los métodos utilizados para mantener segura la IA en inglés no se traducen simplemente a otros idiomas. Cuando los investigadores intentaron usar reglas de seguridad en inglés para idiomas como el hausa, el suajili o el yoruba, los sistemas a menudo colapsaban. El estudio encontró que el simple hecho de traducir un prompt dañino del inglés a un idioma de bajos recursos podía engañar a la IA para que ignorara sus salvaguardas de seguridad casi el ochenta por ciento de las veces, mientras que el mismo truco en inglés fallaría la mayor parte de las veces. Esto sugiere que las lecciones de seguridad aprendidas en inglés no están profundamente arraigadas en la comprensión del mundo del modelo, sino que están ligadas demasiado estrechamente al idioma inglés en sí.

Los investigadores identificaron tres formas principales en las que los científicos están tratando de solucionar este problema. El primer enfoque implica la creación de nuevos datos de entrenamiento que estén arraigados en las culturas locales en lugar de simplemente traducir ejemplos en inglés. Un estudio mostró que cuando construyeron un conjunto de datos de seguridad específicamente para lenguas locales, utilizando ejemplos de daños que realmente existen en esas comunidades, la IA se volvió significativamente mejor al rechazar peticiones peligrosas. En contraste, los modelos entrenados con datos traducidos del inglés a menudo pasaban por alto el matiz de los daños culturales locales. El segundo enfoque intenta enseñar al modelo a ser seguro en un idioma y luego esperar que ese conocimiento se extienda a otros. Sin embargo, la revisión sugiere que esta es una estrategia frágil. Cuando los modelos son ajustados con nuevos idiomas, incluso con datos inofensivos, a veces olvidan las reglas de seguridad que aprendieron en inglés. El tercer enfoque observa dentro de la propia estructura del modelo, intentando ajustar configuraciones internas específicas para hacerlo más seguro sin necesidad de cantidades masivas de nuevos datos. Aunque prometedores, estos métodos aún están en sus primeras etapas y no se ha demostrado que funcionen de manera fiable en todos los idiomas.

Una parte importante del problema reside en cómo probamos estos sistemas. La mayoría de las pruebas de seguridad se construyen traduciendo preguntas en inglés a otros idiomas. Los investigadores encontraron que este método es defectuoso porque no logra capturar las formas específicas en que el daño se manifiesta en diferentes culturas. Por ejemplo, un modelo podría rechazar una petición para generar discurso de odio en inglés, pero podría generar alegremente recomendaciones de productos tóxicos en hausa porque el concepto de ese daño específico no formaba parte de su entrenamiento. La revisión destacó que existen muy pocos parámetros de referencia de seguridad diseñados específicamente para los idiomas africanos, lo que deja un enorme punto ciego en nuestra comprensión de cómo se comportan estos modelos. Sin pruebas que reflejen contextos culturales del mundo real, los desarrolladores no pueden saber si sus medidas de seguridad realmente están funcionando.

El estudio también descubrió una vulnerabilidad sorprendente: el acto de enseñar un nuevo idioma a un modelo a veces puede hacer que sea menos seguro en general. Cuando los investigadores añadieron nuevos idiomas a un modelo que ya era seguro, la capacidad del modelo para rechazar peticiones dañinas en sus idiomas originales a veces se degradó. Esto indica que el proceso de aprender nuevos patrones lingüísticos puede interferir con las restricciones de seguridad ya establecidas. Además, la revisión señaló que cuando las personas mezclan idiomas en una sola oración, una práctica común en muchas partes del mundo, la IA se vuelve mucho más fácil de engañar. Estos prompts de lenguaje mixto pueden eludir los filtros de seguridad que detendrían un ataque de un solo idioma puro.

En última instancia, la revisión concluye que el camino actual de simplemente traducir los datos de seguridad del inglés es insuficiente. Los investigadores argumentan que la verdadera seguridad requiere un cambio hacia la construcción de conjuntos de datos y herramientas de evaluación desde cero en las lenguas locales, involucrando a hablantes nativos para definir qué constituye un daño en sus propios contextos culturales. Sugieren que el progreso futuro depende de equilibrar los datos de entrenamiento para que ningún idioma domine el entendimiento de la seguridad del modelo. Hasta que no se tomen estos pasos, la promesa de una inteligencia artificial segura seguirá fuera del alcance de miles de millones de personas que hablan idiomas distintos al inglés, dejándolas expuestas a riesgos que sus contrapartes angloparlantes no enfrentan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →