PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing
Este artículo presenta PERCEPT, el primer corpus de gran escala de mezcla de códigos persa-inglés anotado con etiquetas de categorías gramaticales (POS) de Universal Dependencies, junto con un marco de anotación asistido por LLM y un análisis lingüístico exhaustivo que revela patrones específicos de la plataforma en la mezcla de códigos a través de las redes sociales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina el internet como un patio de recreo gigante y caótico donde personas de todo el mundo están gritando, susurrando y charlando al mismo tiempo. En este patio de recreo, muchas personas no solo hablan un idioma; los mezclan todos como ingredientes en un batido. Esto se llama "code-mixing" (mezcla de códigos). Es cuando alguien puede empezar una frase en su lengua materna y de repente introduce una palabra en inglés porque se siente de la forma correcta, o porque es la única palabra que conoce para un nuevo dispositivo. Para las computadoras, esto es una pesadilla. Si una computadora está tratando de entender una oración, espera que las palabras sigan reglas estrictas. Pero cuando los idiomas se mezclan, la computadora se confunde, como un chef intentando seguir una receta que de repente cambia de tazas métricas a onzas imperiales en medio de la preparación de un pastel. Para enseñar a las computadoras cómo manejar esta realidad desordenada y divertida, los científicos necesitan un diccionario especial y un conjunto de reglas —un "corpus"— que les muestque exactamente cómo funcionan estas palabras mezcladas.
Entra PERCEPT, un nuevo proyecto que actúa como una biblioteca gigante y organizada para los hablantes de persa que aman mezclar el inglés en sus publicaciones. Los investigadores, un equipo de lingüistas y científicos de la computación de Irán, notaron que mientras tenemos mapas para otros pares de lenguas mixtas, la mezcla entre el persa y el inglés era un bosque oscuro y inexplorado. Querían construir una linterna para ver qué estaba pasando allí. Así que recolectaron 6,800 publicaciones de tres lugares de encuentro digital populares: X (anteriormente Twitter), Instagram y Digikala (un sitio de compras en línea masivo). No solo recolectaron las palabras; utilizaron un asistente de IA superinteligente llamado Gemini para actuar como un detective, etiquetando cada palabra en inglés (o palabra en inglés escrita con letras persas) con su "función" en la oración. En gramática, esta función se llama "Parte de la Oración" (POS, por sus siglas en inglés). ¿Es la palabra un sustantivo (una cosa)? ¿Un verbo (una acción)? ¿Un adjetivo (una descripción)? El equipo también le pidió a la IA que adivinara de qué trataba la publicación, como "compras", "política" o "memes divertidos".
Aquí está la parte emocionante: el equipo no solo construyó la biblioteca; entraron en ella y comenzaron a leer los libros para ver qué patrones podían encontrar. Descubrieron que cuando los hablantes de persa mezclan el inglés, lo usan principalmente para sustantivos (cosas). Es como si estuvieran tomando prestados los "objetos" del inglés pero manteniendo las "acciones" y las "descripciones" en persa. Por ejemplo, podrían decir: "Compré una nueva laptop", donde "laptop" es el sustantivo tomado prestado, pero el resto de la oración permanece en persa. Sin embargo, el "sabor" de la mezcla cambia dependiendo de dónde te encuentres. En el sitio de compras, Digikala, la gente mezclaba muchos nombres de marcas y modelos de productos (que son nombres especiales, o "nombres propios"). En X, mezclaban más verbos (acciones), y en Instagram, se inclinaban hacia los adjetivos (descripciones).
Los investigadores también observaron dónde se esconden estas palabras mezcladas en una oración. Encontraron una consistencia sorprendente: sin importar qué plataforma uses, las palabras mezcladas tienden a aparecer al principio o en el medio de una oración, raramente al puro final. Es como si los hablantes soltaran la palabra en inglés temprano para establecer la escena, y luego terminaran el pensamiento en persa. Pero el descubrimiento más interesante fue sobre el "disparo" (triggering). En Digikala, si alguien usaba una palabra en inglés, era muy probable que usara otra justo después. Es como si, una vez que empezas a hablar de una marca o producto específico, las palabras en inglés simplemente fluyen. Esto no sucedía tanto en Instagram o en X.
Finalmente, revisaron qué temas causaban la mayor cantidad de mezcla. Como era de esperarse, los temas de "Industria y Comercio" y "Marca y Negocios" tuvieron la mayor cantidad de mezcla de códigos. Cuando la gente habla de compras, tecnología o negocios, simplemente no pueden evitar esparcir términos en inglés. El equipo confirmó el trabajo de su IA haciendo que expertos humanos revisaran una muestra, y los humanos estuvieron de acuerdo con la IA casi siempre, demostrando que su nueva biblioteca es confiable.
En resumen, este artículo no solo nos entrega un nuevo conjunto de datos; nos da una imagen clara de cómo los hablantes de persa mezclan los idiomas de forma natural. Sugiere que, si bien los tipos de palabras que toman prestadas cambian según la plataforma, la forma en que las mezclan sigue un ritmo constante. Este mapa ahora está abierto para que cualquiera lo use, ayudando a construir mejores herramientas de traducción, chatbots más inteligentes y una comprensión más profunda de cómo nos comunicamos en un mundo donde los idiomas bailan juntos constantemente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.