SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang
Este artículo presenta "SLAyiNG", el primer conjunto de datos validado por la comunidad de más de 500 términos de jerga queer en inglés a través de 20 subcomunidades, el cual revela que, si bien muchos modelos de lenguaje carecen de sesgo de representación contra las identidades queer, aún tienen dificultades para procesar el vernáculo queer —particularmente la jerga de las comunidades afroamericanas y latinas—, lo que destaca la necesidad de recursos lingüísticos diversos para mejorar los sistemas de PLN.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde las computadoras son como lectores gigantes y voraces que se han tragado casi todos los libros, sitios web y conversaciones jamás escritos. Estas máquinas, conocidas como Modelos de Lenguaje de Gran Escala (LLM, por sus siglas en inglés), son los cerebros detrás de muchos de los chatbots y herramientas de IA que usamos hoy en día. Aprenden detectando patrones en las palabras, intentando adivinar qué sigue en una oración. Pero aquí está el truco: si una computadora nunca ha escuchado una forma específica de hablar, se confunde. Podría pensar que un chiste amistoso es un insulto, o podría no entender por completo una referencia cultural. Este es un gran problema para los "sociolectos": lenguajes especializados utilizados por grupos específicos de personas, como adolescentes, gamers o la comunidad LGBTQ+. Cuando la IA no entiende a estos grupos, puede ser accidentalmente grosera, identificar erróneamente a las personas o simplemente fallar al conversar adecuadamente. La pregunta que los investigadores se están haciendo es: ¿Cómo enseñamos a estos cerebros digitales a entender la rica, colorida y evolutiva jerga de las comunidades queer sin equivocarnos?
Aquí es donde entra un nuevo proyecto llamado SLAYING. Piensa en esto como un diccionario y un libro de cuentos masivo, aprobado por la comunidad, específicamente para la jerga queer. Los investigadores se dieron cuenta de que, aunque la IA está mejorando en la comprensión de muchos tipos de lenguaje, a menudo tropieza con el vernáculo queer. A veces, la IA se confunde tanto que confunde una frase inofensiva y celebratoria con un discurso de odio, o genera una respuesta grosera a un usuario solo porque usó una palabra específica. Para solucionar esto, el equipo construyó el primer conjunto de datos del mundo real de más de 500 términos de jerga queer, con 3,405 ejemplos de cómo se usan realmente estas palabras en oraciones. No solo extrajeron estas palabras de un libro de texto; las recolectaron de películas, podcasts y redes sociales, y luego hicieron que miembros reales de la comunidad queer revisaran cada uno de los ejemplos para asegurarse de que se usaran correctamente y no fueran perjudiciales.
El equipo utilizó este nuevo conjunto de datos para probar algunos modelos de IA populares, y descubrieron algo sorprendente. Descubrieron que una computadora puede ser "amable" con las personas queer (es decir, que no mantiene estereotipos ni las odia) pero seguir siendo "despistada" sobre su lenguaje. Es como tener un amigo que te quiere pero no entiende tus bromas internas favoritas; no está siendo malo, simplemente no entiende la referencia. El estudio mostró que cuando le enseñaron a un modelo de IA utilizando este nuevo conjunto de datos de jerga inofensiva y aprobada por la comunidad, el modelo en realidad mejoró su comprensión de las personas queer en general, no solo de las palabras.
Sin embargo, los investigadores también descubrieron que la IA no está tratando a todos por igual. Los modelos tuvieron más dificultades con la jerga de grupos específicos, particularmente aquellos de las comunidades queer afroamericanas y latinas, así como términos relacionados con el drag y las identidades no binarias. Es como si la IA tuviera un punto ciego para las mismas comunidades que crearon gran parte de la jerga que intenta aprender. Además, el estudio mostró que los sistemas automatizados diseñados para detectar lenguaje "tóxico" a menudo marcan estos términos queer como peligrosos, incluso cuando se están usando de una manera positiva y reivindicada. Esto sugiere que las mismas herramientas destinadas a mantener internet seguro podrían estar censurando accidentalmente las voces queer. El artículo sugiere que, al alimentar a estos modelos con más ejemplos diversos y del mundo real del lenguaje queer, podemos ayudar a que entiendan mejor a la comunidad, reduciendo tanto su confusión como su tendencia a marcar erróneamente el habla inocente como dañina.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.