← Últimos artículos
💬 NLP

General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level

Este artículo presenta el General Phrase Debiaser, un proceso automático de múltiples tokens que mitiga los sesgos a nivel de frase en modelos de lenguaje con enmascaramiento mediante la generación de frases estereotípicas de Wikipedia y su uso para identificar y mitigar los prompts que activan sesgos, logrando reducciones significativas de los estereotipos de género en diversos dominios y tamaños de modelos.

Autores originales: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

Publicado 2026-09-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bingkang Shi, Xiaodan Zhang, Dehan Kong, Yulei Wu, Zongzhen Liu, Honglei Lyu, Longtao Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Las computadoras que leen y escriben lenguaje se han vuelto notablemente hábiles, capaces de resumir noticias, traducir documentos e incluso componer poesía. Estos sistemas, conocidos como modelos de lenguaje, aprenden estudiando vastas cantidades de texto de internet, absorbiendo los patrones, hechos y opiniones contenidos en ellos. Sin embargo, debido a que el lenguaje humano está lleno de prejuicios históricos y estereotipos culturales, estos modelos a menudo aprenden a repetirlos. Una computadora podría asumir que una enfermera es siempre una mujer o que un matemático es siempre un hombre, simplemente porque eso es lo que vio con mayor frecuencia en sus datos de entrenamiento. Este es un problema significativo para cualquiera que intente usar estas herramientas de manera justa, ya que las máquinas pueden reforzar inadvertidamente sesgos dañinos sobre el género, la raza y la profesión. Si bien los investigadores han intentado solucionar estos problemas durante mucho tiempo, la mayoría de los intentos previos se centraron en corregir palabras individuales, tratando el sesgo como una simple cuestión de sustituir algunos términos problemáticos. Sin embargo, el sesgo en el mundo real rara vez vive de forma aislada; se esconde en la forma en que las palabras se combinan en frases y oraciones, donde el significado cambia de maneras sutiles y peligrosas.

Un equipo de investigadores de la Academia China de Ciencias, el Grupo Alibaba y la Universidad de Bristol ha desarrollado un nuevo método para abordar esta capa más profunda de prejuicio. Llaman a su enfoque el Depesador de Frases General (General Phrase Debiaser), un sistema diseñado para limpiar los modelos de lenguaje observando grupos de palabras en lugar de solo palabras individuales. Los investigadores reconocieron que, para solucionar realmente el problema, necesitaban encontrar las frases específicas donde el sesgo del modelo es más fuerte y luego enseñar al modelo a ignorar esas asociaciones. Su proceso comienza con una forma ingeniosa de reunir la evidencia necesaria para la corrección. En lugar de pedir a los humanos que escriban manualmente cada posible frase sesgada, lo cual sería lento e incompleto, el sistema escanea páginas de Wikipedia. Busca hipervínculos que conecten con temas como carreras, matemáticas, arte y ciencia, y utiliza estos para identificar frases estereotípicas que el modelo podría haber aprendido. Por ejemplo, podría encontrar que el modelo asocia fuertemente a "hombre" con "teoría matemática" y a "mujer" con "arte de la danza".

Una vez que el sistema ha identificado estas frases sesgadas, pasa a la segunda etapa: encontrar las preguntas exactas, o prompts, que activan el prejuicio del modelo. Imagine pedirle a la computadora que complete una oración como "La [persona] es experta en [espacio en blanco]". Los investigadores dejan que la computadora busque entre millones de oraciones posibles para encontrar aquellas donde es más probable que realice una suposición sesgada. No buscan solo respuestas de una sola palabra; buscan respuestas de varias palabras, como "teoría matemática" frente a "arte de la danza", porque es ahí donde el verdadero sesgo suele esconderse. Al medir qué tan diferente es la respuesta del modelo a estas frases cuando el sujeto es un hombre frente a una mujer, el sistema calcula una puntuación que representa la fuerza del sesgo. Los investigadores utilizan entonces esta puntuación para guiar un proceso de ajuste fino (fine-tuning). Introducen estas oraciones específicas que activan el sesgo nuevamente en el modelo, pero esta vez, ajustan la configuración interna del modelo para reducir la diferencia en sus respuestas. El objetivo no es borrar el conocimiento del modelo sobre las matemáticas o el arte, sino asegurar que ya no vincule esos campos a un género específico.

Los resultados de este trabajo muestran que atacar las frases es mucho más efectivo que atacar palabras individuales. Los investigadores probaron su método en tres modelos de lenguaje conocidos de diferentes tamaños y encontraron que redujo significamente el sesgo de género tanto en disciplinas académicas como profesionales. En pruebas estándar diseñadas para medir el sesgo, los modelos mejoraron drásticamente. Por ejemplo, uno de los modelos, BERT, vio su puntuación de sesgo caer de 0.35 a 0.12, mientras que otro, ALBERT, cayó de 0.72 a 0.16. Estos números indican que los modelos se volvieron mucho menos propensos a asociar profesiones o campos específicos con un género sobre el otro. Crucialmente, los investigadores también verificaron si este proceso de limpieza dañaba la capacidad de los modelos para entender el lenguaje en general. Hicieron pasar los modelos depesados por una batería de pruebas de lenguaje estándar que cubren gramática, sentimiento y lógica, y encontraron que los modelos conservaron casi todas sus habilidades originales. La capacidad de entender el lenguaje permaneció intacta, demostrando que es posible eliminar los estereotipos dañinos sin romper la inteligencia de la máquina.

Este enfoque marca un cambio en la forma en que los investigadores piensan sobre la corrección de la inteligencia artificial. Los métodos anteriores a menudo dependían de listas externas de palabras escritas por humanos o intentaban corregir todo el vocabulario del modelo a la vez, lo que podía ser ineficiente o pasar por alto el matiz de cómo funciona realmente el sesgo. El Depesador de Frases General, por el contrario, automatiza el descubrimiento de frases sesgadas y apunta a las combinaciones específicas de palabras donde existe el problema. Los investigadores argumentan que esta corrección a nivel de múltiples tokens es esencial porque el sesgo humano rara vez es una sola palabra; es un patrón de asociación que abarca a través de frases. Aunque el estudio se centró en modelos de solo codificador (encoder-only), que son un tipo específico de modelo de lenguaje, los principios que descubrieron podrían aplicarse potencialmente a otros tipos de sistemas también. El trabajo demuestra que, al observar más de cerca la estructura del lenguaje, podemos construir herramientas que no solo sean más inteligentes, sino también más justas, asegurando que las computadoras del futuro reflejen la diversidad del mundo al que sirven en lugar de las limitaciones de sus datos de entrenamiento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →